VLC abierto
OpenVLA: 7B-parámetro modelo de código abierto de visión-lenguaje-acción para robótica. Stanford, Berkeley, TRI, Google DeepMind, MIT.
[← Modelos]
Modelo de acción de lenguaje abierto para la manipulación robótica. Stanford, Berkeley, TRI, Google DeepMind, MIT.
En general
OpenVLA es un modelo de visión-linguego-acción (VLA) de parámetro 7B entrenado en demostraciones de robots del mundo real 970K de Open X-Embodiment. Combina Llama 2 con codificadores visuales fusionados (DINOv2 + SigLIP) y supera a RT-2-X (55B) en un 16,5% con 7× menos parámetros.
Arquitectura y formación
- Parámetros de la serie 7B
- Llama 2 espina dorsal + codificador visual DINOv2/ SigLIP
- 970K demostraciones de Open X-Embodiment
- Transporte multi-robot, con disparos cero
- Ajuste delincuente de LoRA en las GPU de consumo
Enlaces oficiales
- openvla.github.io
Sitio del proyecto - [github.com/openvla/openvla]
T2 ) Código y capacitación - [Cabra de mano: abertura]
T3 ) Modelo de puestos de control
Citación
CoRL 2025. Véase el sitio del proyecto de BibTeX.
Cada VLA aquí puede ser ajustado a sus propias demostraciones.
Recoge demos → Hardware que lo ejecuta → Corre una política →







