El procedimiento de evaluación
InternVLA-M1: marco de acción de visión-lenguaje guiado por el espacio. Shanghai AI Lab, InternRobotics. 71<unk>81% de Google Robot, 95.9% LIBERO.
[← Modelos]
Marco de acción de visión-lenguaje guiado espacialmente para la política generalista de robots.
En general
InternVLA-M1 utiliza una línea de dos etapas: (1) pre-entrenamiento de tierra espacial en muestras de 2,3 M para determinar "dónde actuar", (2) post-entrenamiento de acción guiada espacialmente para "cómo actuar". Modular, extensible, con doble supervisión.
Indicadores de referencia
- Google Robot 71,7% (WidowX), 76,0% (VM), 80,7% (VA)
- LIBERO 95,9% de éxito
- 14,6% en SimplerEnv, + 20,6% en objetos no vistos con co-entrenamiento sintético
Enlaces oficiales
- internrobotics.github.io/internvla-m1
Sitio del proyecto - github.com/InternRobotics/InternVLA-M1
Código (MIT) - [Cabra de la cara: InternRobotics]
T3 ) Modelos y conjuntos de datos
Citación
Consulte el sitio web del proyecto para BibTeX y referencias en papel.
Cada VLA aquí puede ser ajustado a sus propias demostraciones.
Recoge demos → Hardware que lo ejecuta → Corre una política →







