Volver a VLA Models

El procedimiento de evaluación

InternVLA-M1: marco de acción de visión-lenguaje guiado por el espacio. Shanghai AI Lab, InternRobotics. 71<unk>81% de Google Robot, 95.9% LIBERO.

[← Modelos]

Marco de acción de visión-lenguaje guiado espacialmente para la política generalista de robots.

En general

InternVLA-M1 utiliza una línea de dos etapas: (1) pre-entrenamiento de tierra espacial en muestras de 2,3 M para determinar "dónde actuar", (2) post-entrenamiento de acción guiada espacialmente para "cómo actuar". Modular, extensible, con doble supervisión.

Indicadores de referencia

  • Google Robot 71,7% (WidowX), 76,0% (VM), 80,7% (VA)
  • LIBERO 95,9% de éxito
    • 14,6% en SimplerEnv, + 20,6% en objetos no vistos con co-entrenamiento sintético

Enlaces oficiales

Citación

Consulte el sitio web del proyecto para BibTeX y referencias en papel.

Cada VLA aquí puede ser ajustado a sus propias demostraciones.

Recoge demos → Hardware que lo ejecuta → Corre una política →