OpenVLA
OpenVLA: 7B-Parameter Open-Source Vision-Language-Action-Modell für Robotik. Stanford, Berkeley, TRI, Google DeepMind, MIT.
[← Modelle]
Open-Source Vision-Language-Action-Modell für Robotermanipulation. Stanford, Berkeley, TRI, Google DeepMind, MIT.
Überblick
OpenVLA ist ein 7B-Parameter-Vision-Language-Action (VLA) -Modell, das auf 970K-Real-World-Roboter-Demonstrationen von Open X-Embodiment ausgebildet wurde. Es kombiniert Llama 2 mit fusionierten visuellen Encodern (DINOv2 + SigLIP) und übertrifft RT-2-X (55B) um 16,5% mit 7x weniger Parametern.
Architektur und Ausbildung
- 7B Parameter
- Llama 2 Rückgrat + DINOv2/SigLIP visueller Codierer
- 970K Demoen von Open X-Embodiment
- Mehrroboter, Nullschussübertragung
- LoRA-Fein-Ausrichtung auf Konsumenten-GPUs
Offizielle Verbindungen
- openvla.github.io
Projektseite - github.com/openvla/openvla
Code & Training - [Hugs Face: openvla]
T3 ) Modellkontrollstellen
Zitat
CoRL 2025. Siehe die Projektseite für BibTeX.
Jeder VLA hier kann auf Ihre eigenen Demonstrationen abgestimmt werden.
Sammeln Sie Demo → Hardware, das es läuft → Score eine Politik →







