Volver a VLA Models

VLC abierto

OpenVLA: 7B-parámetro modelo de código abierto de visión-lenguaje-acción para robótica. Stanford, Berkeley, TRI, Google DeepMind, MIT.

[← Modelos]

Modelo de acción de lenguaje abierto para la manipulación robótica. Stanford, Berkeley, TRI, Google DeepMind, MIT.

En general

OpenVLA es un modelo de visión-linguego-acción (VLA) de parámetro 7B entrenado en demostraciones de robots del mundo real 970K de Open X-Embodiment. Combina Llama 2 con codificadores visuales fusionados (DINOv2 + SigLIP) y supera a RT-2-X (55B) en un 16,5% con 7× menos parámetros.

Arquitectura y formación

  • Parámetros de la serie 7B
  • Llama 2 espina dorsal + codificador visual DINOv2/ SigLIP
  • 970K demostraciones de Open X-Embodiment
  • Transporte multi-robot, con disparos cero
  • Ajuste delincuente de LoRA en las GPU de consumo

Enlaces oficiales

  • openvla.github.io Sitio del proyecto
  • [github.com/openvla/openvla]T2) Código y capacitación
  • [Cabra de mano: abertura]T3) Modelo de puestos de control

Citación

CoRL 2025. Véase el sitio del proyecto de BibTeX.

Cada VLA aquí puede ser ajustado a sus propias demostraciones.

Recoge demos → Hardware que lo ejecuta → Corre una política →