Zurück zu VLA Models

RT-X vs OpenVLA: Vergleich von Grundmodellen für Robotik

Vergleichen Sie die RT-X-Familie von Google DeepMind mit OpenVLA 7B <unk>-Architekturen, Open-X-Training, Lizenzierung, Zugriff, Hardware-Fußabdruck und welches Fundamentmodell Sie aufbauen sollen.

Die RT-X-Familie von Google DeepMind hat die aktuelle Ära der Basismodelle für die Roboterkontrolle gestartet. OpenVLA ist die offene Gewichtung, die 7B-VLAs für jedes Labor zugänglich machte.

Aktualisiert April 2026 Offene Gewichte vs geschlossen Beide Open-X trainiert

Browse alle Modelle Erhalten Sie eine Empfehlung

TL;DR RT-X (einschließlich RT-1-X und RT-2-X) ist die interne Familie von Actionmodellen von Google DeepMind, die auf Open X-Embodiment ausgebildet ist. RT-1-X Checkpoints wurden unter Apache 2.0 mit JAX/TF-Code veröffentlicht; RT-2-X und Nachfolgermodelle sind proprietär und nicht für externe Bereitstellung verfügbar. ** OpenVLA** ist der 7B MIT-lizenzierte Nachfolger, der von der Community speziell erbaut wurde, weil RT-2-X geschlossen wurde und es RT-2-X auf mehreren Benchmarks mit 7 × weniger Parametern übertraf. Für alles kommerzielle ist OpenVLA die realistische Wahl.

Warum dieser Vergleich wichtig ist

RT-1-X ist die ~35M-Parameter-Transformator-Politik, die von den Autoren von Open-X-Embodiment geschult und offen zur Demonstration des Kreuz-Embodiment-Übertrags. RT-2-X ist die 55B PaLI-X-basierte VLA, die große Multimodale-Modelle zeigen, dass Roboter-Steuerung null-Schuss machen kann. RT-2-X wurde nie veröffentlicht, und später blieben DeepMind-Modelle (Gemini Robotics, RT-H) innerhalb von Google. Wenn Sie "RT-X" als Basis für Ihr eigenes System bewerten, bewerten Sie wirklich which RT-X Checkpoint is available normalerweise nur RT-1-X gegen OpenVLA, das end-to-end mit Gewichten, Code und Adaptern veröffentlicht wurde.

Für eine breitere Ansicht, siehe unser VLA-Modellverzeichnis, die RT-X-Seite, oder die OpenVLA-Seite.

Ein Blick auf den Vergleich

Dimension RT-X family OpenVLA
Parameters RT-1-X ~35M · RT-2-X 55B (PaLI-X based) 7B
Backbone RT-1-X: EfficientNet + token learner + transformer. RT-2-X: PaLI-X multimodal LLM Llama-2 7B + DINOv2 + SigLIP
Action head Discretized action tokens (both variants) Discretized action tokens
Training data Open X-Embodiment (22 embodiments, ~970K traj) Open X-Embodiment (~970K traj)
Language conditioning Strong on RT-2-X, moderate on RT-1-X Strong (LLM-native)
Action space End-effector delta, configurable dim 7-DOF end-effector delta (extensible)
Inference hardware RT-1-X: single GPU. RT-2-X: multi-GPU inference cluster Single A100/H100/L40S bf16
Weights available? RT-1-X: yes. RT-2-X: no (proprietary) Yes, on Hugging Face
License RT-1-X: Apache 2.0. RT-2-X: closed MIT
Fine-tuning RT-1-X fine-tune supported. RT-2-X: no external access LoRA, QLoRA, and full fine-tune recipes published
Paper Open X-Embodiment paper (2023), RT-2 (arXiv:2307.15818) Kim et al., CoRL 2024 (arXiv:2406.09246)
Code github.com/google-deepmind/open_x_embodiment github.com/openvla/openvla

RT-X: Die Familie, die alles begann

RT-1-X die verfügbare

RT-1-X ist das Open X-Embodiment-Re-Training der ursprünglichen RT-1-Architektur von Google: ein EfficientNet-Visuelles Rückgrat, ein FiLM-Sprachkonditionierer, ein Token-Lerner und ein Transformator, der diskretisierte Aktionen ausführt. Es ist klein (~35M Parameter), schnell und kritisch die Gewichte sind auf Hugging Face unter Apache 2.0. Wenn Ihr Anwendungsfall eine mobile Manipulation mit einem Franka- oder Google Robot-Arm ist und Sie eine leichte Basislinie wollen, bleibt RT-1-X auch im Jahr 2026 ein glaubwürdiger Ausgangspunkt.

RT-2-X die man nicht haben kann

RT-2-X ist ein PaLI-X-basierter 55B VLA, der von Google auf den gleichen Open X-Embodiment-Daten ausgebildet wurde. Es hat die These etabliert, dass große VLMs Robotersteuerung durchführen können, aber die Gewichte wurden nie veröffentlicht. Wenn Sie "RT-X-Performance" in einem Blogbeitrag lesen, überprüfen Sie, ob sie den 35M RT-1-X oder den 55B RT-2-X bedeuten.

OpenVLA: die offene Antwort

OpenVLA wurde explizit entwickelt, um die RT-2-X-Lücken für die Open-Source-Community zu schließen. Es ist 7B-Parameter groß genug, um Sprachvorfahren zu erfassen, klein genug, um auf einer High-End-GPU zu dienen. Das [OpenVLA-Papier] T5) berichtet, dass es RT-2-X auf LIBERO-Spatial, LIBERO-Object, LIBERO-Goal und BridgeData V2 mit Nullschuss übertreibt, obwohl es 7 × weniger Parameter verwendet. Es verwendet einen Llama-2 7B LLM mit DINOv2 + SigLIP Vision-Encoder, diskretisiert Aktionen in 256 Bins pro Dimension und ist auf dem gleichen Open X-Embodiment Corpus RT-X Säge ausgebildet.

Wichtiger für die Bauherren: OpenVLA-Schiffe mit einem LoRA-Fein-Tuning-Rezept, mit dem ein Team die Politik auf einem einzigen 80 GB A100 in Stunden anstelle von Tagen an einen neuen Roboter anpassen kann.

Die Frage nach Lizenz- und Zugangsrecht

Dies ist in der Regel der entscheidende Faktor. RT-1-X unter Apache 2.0 ist kommerziell, aber alt und klein. RT-2-X ist überhaupt nicht lizenzierbar. OpenVLA unter MIT ist der einzige Weg, um RT-2-Klasse-Verhalten in einem kommerziell verwendbaren Paket zu erhalten. Teams, die in 2026 echte Roboter versenden insbesondere [Warehouse-Implementierungen]T6) oder [Laboratoriumautomation]T7) installiert, die explizite Rechte benötigen fast immer auf OpenVLA oder einem seiner Derivate landen.

Hardware-Footprint

RT-1-X läuft auf einer einzigen GPU mit Echtzeitraten und wurde auf einer Reihe von Robotern von Franka bis Google Robot demonstriert. Es ist die leichte Option. OpenVLA benötigt ~16 GB VRAM in bfloat16 und läuft in der Regel bei 510 Hz auf einem A100 ohne Quantifizierung , was für die meisten Manipulationen gut ist, aber für geschickte Steuerung eng ist. Teams paaren OpenVLA oft mit Action-Cunking und einem Impedance-Controller auf niedrigerer Ebene, um die erforderliche Schleiferate zu erreichen. RT-2-X, wenn es verfügbar wäre, würde einen Multi-GPU-Inferenzserver benötigen.

Wenn RT-1-X noch Sinn macht

  • Sie wollen die kleinste, schnellste Open-X-Basislinie und brauchen kein starkes Sprachverständnis.
  • Sie vergleichen einen Übertragung von Leibkörpern in einer Studie und wollen eine historisch fundierte Basis.
  • Sie arbeiten auf Edge-Hardware, wo ein 7B-Modell nicht lebensfähig ist.

Wenn OpenVLA die offensichtliche Wahl ist

  • Sie wollen RT-2-Klasse-Sprachverhalten mit Gewichten, die Sie tatsächlich herunterladen können.
  • Sie brauchen einen kommerziellen Lizenzweg (MIT).
  • Sie wollen eine aktive Community mit LoRA-Adaptern, quantifizierten Varianten und Einsatzrezepten.
  • Sie planen, auf Ihre eigenen Teleop-Daten zu optimieren Die Dokumentation von OpenVLA ist wesentlich besser als die von RT-X für den Nachstrom.

Ehrliche Abmachungen

DeepMind hat weiterhin interne Modelle weit über RT-2-X hinausgedrängt, und der Produktionsabbau von Google verwendet geschlossene Nachkommen. Was OpenVLA is, eindeutig, ist das beste Open-Weight-Fundament-Modell in der RT-X-Linie. Wenn Sie SOTA-at-any-Cost brauchen und mit DeepMind zusammenarbeiten können, ist das ein anderes Gespräch. Wenn Sie ein Produkt bauen, ist OpenVLA MIT-Gewichte plus eine Supabase-hosted-Datenpipeline plus [Teleoperations-Daten-Sammlung]T8) ein realistischer Stapel heute.

Benchmarks und Bewertung

Beide Modellfamilien veröffentlichen Zahlen auf [LIBERO]T9), [Google Robot]T10) und [RLBench]T11). OpenVLA LIBERO-Zahlen sind im Papier und reproduzierbar. RT-X-Zahlen variieren je nach Variante Vorsicht, welche RT-X-Zeile Sie zitieren.

Wenn Sie eine Benchmark-Angabe mit RT-X lesen, stellen Sie immer drei Fragen: Welche RT-X-Variante (RT-1-X oder RT-2-X), welche Ausführungsuntergruppe von Open X-Embodiment wurde zur Bewertung verwendet, und ob der Roboter der reale WidowX von Google oder eine externe Reproduktion war. OpenVLA-Evaluierungen sind im Allgemeinen einfacher zu interpretieren, da das Papier explizit über Checkpoint, Protokoll und Datensatzsplitts steht.

Rezepte für die Feinschaltung und den Einsatz

Nachgelagerte Teams, die mit RT-1-X arbeiten, tun in der Regel auf engere Aufgabenmengen im Rahmen des Open X-Embodiment-Umbrella ein, indem sie nur die für ihre Zielverkörperung relevanten Flugbahnen auswählen und dann eine kurze Trainingsschleife durchführen, um die Politik auf ihre spezifische Hardware zu bringen. Der RT-1-X-Schulungscode ist reif, aber nur wenig in Bezug auf die Produktionsleitlinien, und das meiste der nachgelagerten Kenntnisse liegt eher in Papieren als in Rezepten.

Die offizielle Repository liefert ein LoRA-Feine-Tune-Beispiel, ein vollständiges Feine-Tune-Beispiel, ein Datensatzkonvertierungswerkzeug für benutzerdefinierte RLDS-Daten und Referenzkonfigurationen für mehrere beliebte Roboter. Die Community hat 4-Bit-Quantifizierung, vLLM-Serving und Integration mit [LeRobot] T13 hinzugefügt. Für ein Team, das in weniger als einem Monat von "wir haben Teleop-Daten" zu "wir haben eine Politik für unseren Roboter" übergehen muss, ist das Werkzeug von OpenVLA der entscheidende Vorteil.

Was DeepMind als nächstes versendet

Google DeepMind hat fortgesetzt, das vergangene RT-2-X intern zu iteratieren. Gemini Robotics und verwandte Projekte erweitern die Grundlagenmodell-für-Robotik-These mit größeren VLMs und engerer Kopplung zu Produktion Google Roboter. Keiner dieser Checkpoints wurde für externe Bereitstellung zur Verfügung gestellt, so dass aus der Sicht eines Bauherrschen sind sie zu lesen wert, aber nicht wert, aufzubauen. OpenVLA, pi0 und die LeRobot-Ökosystemmodelle sind der realistische Weg für Open-Source-Arbeit.

Unsere Empfehlung

Für fast jedes praktische Team ist OpenVLA heute die Antwort. Es erbt die RT-X-Linie intellektuell, entspricht oder schlägt RT-2-X auf öffentlichen Benchmarks, Schiffe mit offenem Gewicht unter MIT und verfügt über ein aktives Feinstimmungs-Ökosystem. RT-1-X bleibt eine feine kleine Basislinie, aber Sie werden eher [Octo]T14) oder eine kleine Diffusionpolitik für diese Rolle im Jahr 2026 verwenden. RT-2-X ist eine Papierreferenz zitieren Sie es, bauen Sie nicht darauf auf.

Verwandte Lesung OpenVLA vs. Octo → Diffusion Policy vs. ACT → Beste VLA Modelle 2026 → Offene X-Embodiment Datensatz → OpenVLA Modellseite → RT-X Modellseite →

Jeder VLA hier kann auf Ihre eigenen Demonstrationen abgestimmt werden.

Sammeln Sie Demo → Hardware, die es läuft → Score eine Politik →