VLA-Modelle verglichen: RT-2, OpenVLA, Pi0, SmolVLA, RoboFlamingo (2025)
Vollständiger Vergleich von Vision-Language-Action (VLA) Modellen: RT-2, OpenVLA, Pi0, SmolVLA, RoboFlamingo. Parameter, Trainingsdaten, Ableitungsgeschwindigkeit, Hardwareanforderungen, Open-Source-Status und wann man sich im Vergleich zum Zug von Grund auf auf einstellen soll.
[← Forschung]
Ein praktischer Vergleich der wichtigsten Modelle Vision-Language-Action
VLA modelliert die Grundspracheinstructions in der visuellen Wahrnehmung, um Roboteraktionen zu erzeugen
Die Programme für die Vision Language LLM
Was ist ein VLA-Modell?
Ein Vision-Language-Action-Modell (VLA) ist ein neuronales Netzwerk, das visuelle Beobachtungen (Kamerabilder) und eine natürliche Sprachanweisung als Eingabe nimmt und Roboter-Aktionsvorhersagen als Ausgabe erzeugt. Der Schlüsselunterschied zu früheren Modellen des Roboterlernens ist die Language-Conditionierung: Das gleiche Modell kann unterschiedlichen Anweisungen folgen, ohne umzubilden, was eine Aufgabenverallgemeinerung ermöglicht, die reine Imitations-Lernpolitik nicht erreichen kann.
Die typische VLA-Architektur verknüpft drei Komponenten:
- Vision-Coder: Verarbeitet Rohpixel-Beobachtungen in eine Feature-Repräsentation (meist ein CLIP ViT oder SigLIP)
- Sprachmodell-Spielpunkt: Ein vorgebildeter LLM (Llama, Gemma, PaLM, Flamingo-Stil), der neben Sprach-Token visuelle Token erhält und gemeinsam über beide
- Action Head: Ein leichter Dekoder, der LLM-Ausgabe-Token auf Roboter-Aktionsvorhersagen abbildet
entweder diskretisierte Aktions-Token (wie RT-2) oder kontinuierliche Aktionsvektoren (wie OpenVLA, Pi0)
Die Voraussetzung ist, dass die Internet-Skala-Vorbildung auf Vision-Language-Daten dem LLM ein backbone-gestütztes Weltwissen gibt, das mit weit weniger roboterspezifischen Daten als der Training von Grund auf zur Roboternappilation übergeht.
Die fünf Modelle: Was Sie wissen müssen
RT-2 (Google DeepMind, 2023)
RT-2 (Robotic Transformer 2) ist ein VLA, das von Google DeepMind auf PaLI-X (55B-Parameter) und PaLM-E (562B-Parameter) aufgebaut wurde. Es feint ein massives Vision-Language-Modell von Ende zu Ende auf Roboter-Demonstrationen ein und stellt Aktionen als Text-Token im gleichen Vokabular wie das Sprachmodell dar. Das Ergebnis ist ein Modell, das über neuartige Anweisungen zu der Zeit der Schlussfolgerung reden kann
RT-2 hat neue Argumentationsfähigkeiten gezeigt: die Gedankenkette veranlasst eine verbesserte Aufgabenleistung, und das Modell könnte faktische Fragen mitten in der Ausführung beantworten. Es ist jedoch ** geschlossener Quell**
OpenVLA (Stanford + UC Berkeley, 2024)
OpenVLA ist das erste vollständig Open-Source, groß angelegte VLA-Modell. Es basiert auf Prismatic VLM (7B-Parameter, basierend auf Llama 2 + SigLIP Vision Encoder) und auf 970k Roboter-Demonstrationen von Open X-Embodiment. OpenVLA diskretisiert Aktionen in 256 Bins pro Dimension und prognostiziert sie als Sprachtoken nach der Formulierung von RT-2.
Das vollständige Trainingsrezept, Modellgewichte und Feintuning-Code sind öffentlich auf HuggingFace verfügbar. Feintuning OpenVLA auf einer neuen Aufgabe erfordert in der Regel 50
Pi0 (Physische Intelligenz, 2024)
Pi0 ist ein VLA von Physical Intelligence (pi.ai), dem Startup, das von Sergey Levine, Chelsea Finn und anderen der Berkeley-Roboter-Community gegründet wurde. Pi0 verwendet einen Flow-Matching-Action-Head anstelle von diskreten Action-Token. Das Basismodell basiert auf PaliGemma (3B-Parameter) mit einem diffusionsinspirerten Aktionsgenerationskopf.
Pi0 ist bemerkenswert, dass sie in der realen Welt eine geschickte Manipulation auf einem Niveau demonstriert hat, das von VLAs mit offenem Gewicht nicht zuvor gezeigt wurde: Klappwäsche, reinigende unordnete Tische, Einbau von Objekten. Physical Intelligence bietet kommerzielle Fein-Tuning-Dienste.
Die Kommission hat die Kommission mit der Erhebung der Richtlinie 2009/138/EG in Bezug auf die Einführung eines neuen Systems zur Überwachung der Einfuhren von Waren aus Drittländern in den Mitgliedstaaten mitgeteilt.
SmolVLA ist HuggingFace's Eintritt in den VLA-Raum. Ein absichtlich kleiner, effizienter VLA, der für die Laufung auf Verbraucherhardware entwickelt wurde. SmolVLA verwendet SmolLM2 (135M
SmolVLA führt die Ableitung bei ~30 Hz auf einem RTX 3090 aus, was ihn zum ersten wirklich praktischen VLA für die Echtzeit-Robotersteuerung ohne Enterprise-GPUs macht. Es ist auf LeRobot-Datensätzen ausgebildet und integriert sich natively mit dem LeRobot-Trainingstack. Die Leistung verlässt OpenVLA bei komplexen offenen Wortschatz-Aufgaben, entspricht aber bei engen Aufgabenbereichen nach Fein-Tuning oder übersteigt es. Für Labors mit begrenztem GPU-Budget ist SmolVLA der zugänglichste Ausgangspunkt.
RoboFlamingo (Beijing Institute of Technology + Microsoft Research, 2023)
RoboFlamingo feint das OpenFlamingo Vision-Language-Modell (9B-Parameter, basierend auf MPT-7B + CLIP ViT-L) für Robotermanipulation. Im Gegensatz zu RT-2 und OpenVLA ist RoboFlamingo ** dekodierende nur**
RoboFlamingo ist in erster Linie ein Forschungsergebnis und nicht ein Produktions-ready-Modell. Seine Schlüsselinformationen sind, dass die Lernfähigkeit von OpenFlamingo im Kontext (ein paar Demonstrationsbeispiele direkt im Kontextfenster zu speichern) sich auf die Roboternappilation überträgt: Sie können 1
Vergleichstabelle auf den Blick
| Model | Params | Base LLM | Training Data | Inference Hz | Open Source? | Fine-tune? |
|---|---|---|---|---|---|---|
| RT-2 | 55B / 562B | PaLI-X / PaLM-E | RT-1 dataset + web | 1–3 Hz | No (Google internal) | No |
| OpenVLA | 7B | Llama 2 + SigLIP | Open X-Embodiment (970k) | 6 Hz (A100) | Yes (weights + code) | Yes (LoRA / full) |
| Pi0 | ~3B | PaliGemma | pi.ai proprietary | 10–25 Hz | Weights (research) | Via pi.ai (commercial) |
| SmolVLA | 450M–2B | SmolLM2 + SigLIP | LeRobot datasets | 30 Hz (RTX 3090) | Yes (fully open) | Yes (LeRobot native) |
| RoboFlamingo | 9B | OpenFlamingo (MPT-7B) | Open X-Embodiment | 3–5 Hz (A100) | Yes (weights + code) | Yes (+ in-context) |
Hardwareanforderungen für jedes Modell
| Model | Min GPU (inference) | Recommended (inference) | Fine-tuning GPU | VRAM (inference) |
|---|---|---|---|---|
| RT-2 | N/A (not available) | TPU pod (Google) | N/A | N/A |
| OpenVLA | RTX 3090 (slow) | A100 40GB | A100 80GB (full) / RTX 4090 (LoRA) | ~16GB (BF16) |
| Pi0 | RTX 3090 | RTX 4090 / A100 | A100 40GB | ~8GB (BF16) |
| SmolVLA | RTX 3080 10GB | RTX 3090 | RTX 3090 / RTX 4090 | 2–6GB |
| RoboFlamingo | A100 40GB | A100 80GB | 2× A100 80GB | ~22GB (BF16) |
Aktionsrepräsentationen: Ein entscheidender Unterschied
Wie jedes Modell Aktionen ausführt, bestimmt, welche Aufgaben es gut erledigen kann und wie schnell es laufen kann:
- ** Diskrete Aktionstoken (RT-2, OpenVLA, RoboFlamingo):** Aktionen werden in Behälter (typischerweise 256 pro Dimension) quantiziert und als Texttoken vom LLM vorhergesagt.
- Continuous Action Head mit Flow Matching (Pi0): Aktionen werden durch einen diffusionsgeisteten Flow Matching-Prozess als kontinuierliche Vektoren vorhergesagt.
- Hybrid-Token + Continuous (SmolVLA): Sprach-Token für den Rationalisierungsvorgang; kontinuierliche Ausgabe-Head für die Aktion.
Wann man sich auf die Schrittweise einstellen sollte
Für praktisch alle Teams ist das Feinstellen eines vorgeübten VLA der richtige Ausgangspunkt. Das Training eines VLA von Grund auf erfordert Millionen von Roboterdemonstrationen und massive Computerressourcen, die nur Google, DeepMind und Physical Intelligence marscheln können.
Feine Abklärung, wenn:
- Ihre Ziel Aufgaben sind in Stil ähnlich wie die vor-Schulungsdaten (Tisch-Manipulation, Pick-and-Place, Küchen-Tätigkeiten)
- Sie haben 50
500 Demonstrationen der Ziel-Aufgabe - Ihre Robotermorphologie ist in Open X-Embodiment oder LeRobot Datensätzen dargestellt.
- Sie brauchen eine vernünftige Null-Schuss-Generalisierung innerhalb einer Aufgabenkategorie
Zug von Grund auf (oder nutzen Sie eine Nicht-VLA-Politik), wenn:
- Ihre Aufgabenbereich ist radikal anders als vor-training (Underwasser-Manipulation, chirurgische Robotik, industrielle Montage)
- Ihr Aktionsraum ist nicht standardmäßig (z. B. Hydraulik, Kabelantrieb, >7 DoF-Hände)
- Sie benötigen eine maximale Schnellheit der Ableitung und können sich die Aufgabenallgemeinheit begrenzen
In diesem Fall wird ACT oder Diffusion Policy, die von Grund auf ausgebildet ist, eine fein abgestimmte VLA bei einer bestimmten schmalen Aufgabe übertreffen - Die Schwerpunkte der Interpretation oder Sicherheit machen große LLM-Rückgraten problematisch
OpenVLA: Praktische Schritte
OpenVLA ist der zugänglichste Ausgangspunkt für Labors, die ihre eigenen Feintuning-Anwendungen durchführen möchten.
# Install OpenVLA dependencies
pip install openvla
# Fine-tune with LoRA (requires single RTX 4090)
python experiments/robot/finetune.py \
--pretrained_checkpoint openvla/openvla-7b \
--data_root_dir /path/to/your/lerobot/dataset \
--dataset_name your_task_name \
--run_root_dir ./runs \
--use_lora True \
--lora_rank 32 \
--batch_size 16 \
--num_steps 10000 \
--learning_rate 2e-4
Erwartete Feintuning-Zeit mit LoRA auf RTX 4090: ~6 Stunden für 10k Schritte mit 100 Demonstrationen. Vollständige Feintuning erfordert ein A100 80GB und dauert ~18
SmolVLA: Praktische Schritte
SmolVLA integriert sich direkt mit LeRobot, was es zum schnellsten Weg zu einem laufenden VLA auf Ihrem Roboter macht:
python lerobot/scripts/train.py \
policy=smolvla \
env=aloha \
dataset_repo_id=your-username/your-dataset \
hydra.run.dir=outputs/train/smolvla_task \
training.batch_size=32 \
training.num_epochs=100 \
policy.pretrained_backbone_kwargs.pretrained=true
Welches Modell solltest du verwenden?
Beginnen Sie mit SmolVLA, wenn:
- Ihr Labor verfügt über Verbraucher-GPUs (RTX 3090 oder ähnlich)
- Sie nutzen das LeRobot-Ökosystem bereits .
- Sie wollen den schnellsten Iterationszyklus von Demo-Sammlung bis zu Roboter-Förderung
- Ihre Aufgabe ist relativ schmal (ein Tisch, einheitliche Beleuchtung, bekannte Objekte)
OpenVLA wird verwendet, wenn:
- Sie brauchen die beste verfügbare Open-Source-Generalisierung Leistung
- Sie haben Zugang zu einem A100 oder H100
- Ihre Aufgabe beinhaltet neue Objektkategorien oder Anweisungsfrasen, die während der Ausbildung nicht gesehen wurden
- Sie wollen, dass die veröffentlichten Benchmark-Ergebnisse verglichen werden
Die P0 ist zu berücksichtigen, wenn:
- Sie benötigen eine geschickte Manipulationsqualität (Mehrfinger, kontaktreich)
- Sie sind offen für die Arbeit mit physischer Intelligenz für Fein-Tuning
- Ihre Aufgabe erfordert eine höhere Steuerfrequenz als OpenVLA bereitstellen kann
Verwenden Sie RoboFlamingo, wenn:
- Sie möchten in Kontext Roboter-Lernen (Anpassung an neue Aufgaben mit Demonstrationsbeispielen im Kontextfenster, keine Gradient-Updates)
- Sie forschen an der Verallgemeinerung von wenigen Schüssen, anstatt die Leistung zu optimieren
Referenz RT-2 wenn:
- Festlegung theoretischer Obergrenzen für die Leistung von VLA auf einem Benchmark
- Schriftbezogene Arbeiten
es ist die kanonische VLA-Verweis - Aber planen Sie Ihr System nicht um es herum
es ist nicht bereitgestellt
Datenanforderungen für eine erfolgreiche Fein-Tuning
Unabhängig davon, welches Modell Sie wählen, ist die Demonstrationsqualität die wichtigste Variable. VLAs, die auf laute, inkonsistente oder schlecht formatierte Daten abgestimmt sind, werden kleinere, nicht-VLA-Politiken, die auf saubere Daten ausgebildet sind, unterlegen.
- Konsistenz der Kameraanlage: Die VLA wurde vorab bei Demonstrationen mit spezifischen Kamerakonfigurationen ausgebildet.
- Episodeformat: HDF5 (RLDS-kompatibel) oder LeRobot-Nativformat. OpenVLA erfordert RLDS; SmolVLA bevorzugt LeRobot. Konvertieren Sie vor dem Training, nicht während.
- Sprachenanmerkungen: Jede Episode benötigt eine Natursprachenanweisungsschnur. Für schmale Aufgaben funktioniert eine einzige feste Anweisung pro Aufgabe. Für die Verallgemeinerung variieren Sie die Phrasen während der Sammlung.
- Minimum Demo-Zahl: SmolVLA: 50+; OpenVLA: 100+; Pi0: 200+ für neue Aufgabenarten.
Wir bieten [Daten-Sammlungsdienste]
Alle Modelle → ACT vs. Diffusion Policy → OpenVLA vs. Octo →
Das Lesen über die Bewertung ist eine Sache
Run a real-world eval → Kommission Evaluation Daten → Hardware für Ihre Evaluation Rig →







