Zurück zu VLA Models

OpenVLA

OpenVLA: 7B-Parameter Open-Source Vision-Language-Action-Modell für Robotik. Stanford, Berkeley, TRI, Google DeepMind, MIT.

[← Modelle]

Open-Source Vision-Language-Action-Modell für Robotermanipulation. Stanford, Berkeley, TRI, Google DeepMind, MIT.

Überblick

OpenVLA ist ein 7B-Parameter-Vision-Language-Action (VLA) -Modell, das auf 970K-Real-World-Roboter-Demonstrationen von Open X-Embodiment ausgebildet wurde. Es kombiniert Llama 2 mit fusionierten visuellen Encodern (DINOv2 + SigLIP) und übertrifft RT-2-X (55B) um 16,5% mit 7x weniger Parametern.

Architektur und Ausbildung

  • 7B Parameter
  • Llama 2 Rückgrat + DINOv2/SigLIP visueller Codierer
  • 970K Demoen von Open X-Embodiment
  • Mehrroboter, Nullschussübertragung
  • LoRA-Fein-Ausrichtung auf Konsumenten-GPUs

Offizielle Verbindungen

Zitat

CoRL 2025. Siehe die Projektseite für BibTeX.

Jeder VLA hier kann auf Ihre eigenen Demonstrationen abgestimmt werden.

Sammeln Sie Demo → Hardware, das es läuft → Score eine Politik →