RT-X vs OpenVLA: Vergleich von Grundmodellen für Robotik
Vergleichen Sie die RT-X-Familie von Google DeepMind mit OpenVLA 7B <unk>-Architekturen, Open-X-Training, Lizenzierung, Zugriff, Hardware-Fußabdruck und welches Fundamentmodell Sie aufbauen sollen.
Die RT-X-Familie von Google DeepMind hat die aktuelle Ära der Basismodelle für die Roboterkontrolle gestartet. OpenVLA ist die offene Gewichtung, die 7B-VLAs für jedes Labor zugänglich machte.
Aktualisiert April 2026 Offene Gewichte vs geschlossen Beide Open-X trainiert
Browse alle Modelle Erhalten Sie eine Empfehlung
TL;DR RT-X (einschließlich RT-1-X und RT-2-X) ist die interne Familie von Actionmodellen von Google DeepMind, die auf Open X-Embodiment ausgebildet ist. RT-1-X Checkpoints wurden unter Apache 2.0 mit JAX/TF-Code veröffentlicht; RT-2-X und Nachfolgermodelle sind proprietär und nicht für externe Bereitstellung verfügbar. ** OpenVLA** ist der 7B MIT-lizenzierte Nachfolger, der von der Community speziell erbaut wurde, weil RT-2-X geschlossen wurde
Warum dieser Vergleich wichtig ist
RT-1-X ist die ~35M-Parameter-Transformator-Politik, die von den Autoren von Open-X-Embodiment geschult und offen zur Demonstration des Kreuz-Embodiment-Übertrags. RT-2-X ist die 55B PaLI-X-basierte VLA, die große Multimodale-Modelle zeigen, dass Roboter-Steuerung null-Schuss machen kann. RT-2-X wurde nie veröffentlicht, und später blieben DeepMind-Modelle (Gemini Robotics, RT-H) innerhalb von Google. Wenn Sie "RT-X" als Basis für Ihr eigenes System bewerten, bewerten Sie wirklich which RT-X Checkpoint is available
Für eine breitere Ansicht, siehe unser VLA-Modellverzeichnis, die RT-X-Seite, oder die OpenVLA-Seite.
Ein Blick auf den Vergleich
| Dimension | RT-X family | OpenVLA |
|---|---|---|
| Parameters | RT-1-X ~35M · RT-2-X 55B (PaLI-X based) | 7B |
| Backbone | RT-1-X: EfficientNet + token learner + transformer. RT-2-X: PaLI-X multimodal LLM | Llama-2 7B + DINOv2 + SigLIP |
| Action head | Discretized action tokens (both variants) | Discretized action tokens |
| Training data | Open X-Embodiment (22 embodiments, ~970K traj) | Open X-Embodiment (~970K traj) |
| Language conditioning | Strong on RT-2-X, moderate on RT-1-X | Strong (LLM-native) |
| Action space | End-effector delta, configurable dim | 7-DOF end-effector delta (extensible) |
| Inference hardware | RT-1-X: single GPU. RT-2-X: multi-GPU inference cluster | Single A100/H100/L40S bf16 |
| Weights available? | RT-1-X: yes. RT-2-X: no (proprietary) | Yes, on Hugging Face |
| License | RT-1-X: Apache 2.0. RT-2-X: closed | MIT |
| Fine-tuning | RT-1-X fine-tune supported. RT-2-X: no external access | LoRA, QLoRA, and full fine-tune recipes published |
| Paper | Open X-Embodiment paper (2023), RT-2 (arXiv:2307.15818) | Kim et al., CoRL 2024 (arXiv:2406.09246) |
| Code | github.com/google-deepmind/open_x_embodiment | github.com/openvla/openvla |
RT-X: Die Familie, die alles begann
RT-1-X die verfügbare
RT-1-X ist das Open X-Embodiment-Re-Training der ursprünglichen RT-1-Architektur von Google: ein EfficientNet-Visuelles Rückgrat, ein FiLM-Sprachkonditionierer, ein Token-Lerner und ein Transformator, der diskretisierte Aktionen ausführt. Es ist klein (~35M Parameter), schnell und
RT-2-X die man nicht haben kann
RT-2-X ist ein PaLI-X-basierter 55B VLA, der von Google auf den gleichen Open X-Embodiment-Daten ausgebildet wurde. Es hat die These etabliert, dass große VLMs Robotersteuerung durchführen können, aber die Gewichte wurden nie veröffentlicht. Wenn Sie "RT-X-Performance" in einem Blogbeitrag lesen, überprüfen Sie, ob sie den 35M RT-1-X oder den 55B RT-2-X
OpenVLA: die offene Antwort
OpenVLA wurde explizit entwickelt, um die RT-2-X-Lücken für die Open-Source-Community zu schließen. Es ist 7B-Parameter
Wichtiger für die Bauherren: OpenVLA-Schiffe mit einem LoRA-Fein-Tuning-Rezept, mit dem ein Team die Politik auf einem einzigen 80 GB A100 in Stunden anstelle von Tagen an einen neuen Roboter anpassen kann.
Die Frage nach Lizenz- und Zugangsrecht
Dies ist in der Regel der entscheidende Faktor. RT-1-X unter Apache 2.0 ist kommerziell, aber alt und klein. RT-2-X ist überhaupt nicht lizenzierbar. OpenVLA unter MIT ist der einzige Weg, um RT-2-Klasse-Verhalten in einem kommerziell verwendbaren Paket zu erhalten. Teams, die in 2026 echte Roboter versenden
Hardware-Footprint
RT-1-X läuft auf einer einzigen GPU mit Echtzeitraten und wurde auf einer Reihe von Robotern von Franka bis Google Robot demonstriert. Es ist die leichte Option. OpenVLA benötigt ~16 GB VRAM in bfloat16 und läuft in der Regel bei 5
Wenn RT-1-X noch Sinn macht
- Sie wollen die kleinste, schnellste Open-X-Basislinie und brauchen kein starkes Sprachverständnis.
- Sie vergleichen einen Übertragung von Leibkörpern in einer Studie und wollen eine historisch fundierte Basis.
- Sie arbeiten auf Edge-Hardware, wo ein 7B-Modell nicht lebensfähig ist.
Wenn OpenVLA die offensichtliche Wahl ist
- Sie wollen RT-2-Klasse-Sprachverhalten mit Gewichten, die Sie tatsächlich herunterladen können.
- Sie brauchen einen kommerziellen Lizenzweg (MIT).
- Sie wollen eine aktive Community mit LoRA-Adaptern, quantifizierten Varianten und Einsatzrezepten.
- Sie planen, auf Ihre eigenen Teleop-Daten zu optimieren
Die Dokumentation von OpenVLA ist wesentlich besser als die von RT-X für den Nachstrom.
Ehrliche Abmachungen
DeepMind hat weiterhin interne Modelle weit über RT-2-X hinausgedrängt, und der Produktionsabbau von Google verwendet geschlossene Nachkommen. Was OpenVLA is, eindeutig, ist das beste Open-Weight-Fundament-Modell in der RT-X-Linie. Wenn Sie SOTA-at-any-Cost brauchen und mit DeepMind zusammenarbeiten können, ist das ein anderes Gespräch. Wenn Sie ein Produkt bauen, ist OpenVLA MIT-Gewichte plus eine Supabase-hosted-Datenpipeline plus [Teleoperations-Daten-Sammlung]
Benchmarks und Bewertung
Beide Modellfamilien veröffentlichen Zahlen auf [LIBERO]
Wenn Sie eine Benchmark-Angabe mit RT-X lesen, stellen Sie immer drei Fragen: Welche RT-X-Variante (RT-1-X oder RT-2-X), welche Ausführungsuntergruppe von Open X-Embodiment wurde zur Bewertung verwendet, und ob der Roboter der reale WidowX von Google oder eine externe Reproduktion war. OpenVLA-Evaluierungen sind im Allgemeinen einfacher zu interpretieren, da das Papier explizit über Checkpoint, Protokoll und Datensatzsplitts steht.
Rezepte für die Feinschaltung und den Einsatz
Nachgelagerte Teams, die mit RT-1-X arbeiten, tun in der Regel auf engere Aufgabenmengen im Rahmen des Open X-Embodiment-Umbrella ein, indem sie nur die für ihre Zielverkörperung relevanten Flugbahnen auswählen und dann eine kurze Trainingsschleife durchführen, um die Politik auf ihre spezifische Hardware zu bringen. Der RT-1-X-Schulungscode ist reif, aber nur wenig in Bezug auf die Produktionsleitlinien, und das meiste der nachgelagerten Kenntnisse liegt eher in Papieren als in Rezepten.
Die offizielle Repository liefert ein LoRA-Feine-Tune-Beispiel, ein vollständiges Feine-Tune-Beispiel, ein Datensatzkonvertierungswerkzeug für benutzerdefinierte RLDS-Daten und Referenzkonfigurationen für mehrere beliebte Roboter. Die Community hat 4-Bit-Quantifizierung, vLLM-Serving und Integration mit [LeRobot]
Was DeepMind als nächstes versendet
Google DeepMind hat fortgesetzt, das vergangene RT-2-X intern zu iteratieren. Gemini Robotics und verwandte Projekte erweitern die Grundlagenmodell-für-Robotik-These mit größeren VLMs und engerer Kopplung zu Produktion Google Roboter. Keiner dieser Checkpoints wurde für externe Bereitstellung zur Verfügung gestellt, so dass aus der Sicht eines Bauherrschen sind sie zu lesen wert, aber nicht wert, aufzubauen. OpenVLA, pi0 und die LeRobot-Ökosystemmodelle sind der realistische Weg für Open-Source-Arbeit.
Unsere Empfehlung
Für fast jedes praktische Team ist OpenVLA heute die Antwort. Es erbt die RT-X-Linie intellektuell, entspricht oder schlägt RT-2-X auf öffentlichen Benchmarks, Schiffe mit offenem Gewicht unter MIT und verfügt über ein aktives Feinstimmungs-Ökosystem. RT-1-X bleibt eine feine kleine Basislinie, aber Sie werden eher [Octo]
Verwandte Lesung OpenVLA vs. Octo → Diffusion Policy vs. ACT → Beste VLA Modelle 2026 → Offene X-Embodiment Datensatz → OpenVLA Modellseite → RT-X Modellseite →
Jeder VLA hier kann auf Ihre eigenen Demonstrationen abgestimmt werden.
Sammeln Sie Demo → Hardware, die es läuft → Score eine Politik →







