Öffnen Sie X-Bodyment vs DROID: Welchen Roboter-Datensatz sollten Sie verwenden?
Öffnen Sie X-Embodiment vs DROID: Trajektorienskala, Ausführungsformen, Datensatz, Lizenz und Schulungsrechnung im Vergleich. Wählen Sie den richtigen Basismodell-Roboter-Datenbestand im Jahr 2026.
Open X-Embodiment und DROID sind die beiden größten offenen Roboter-Lerndatenmengen im Jahr 2026. Sie liegen an den gegenüberliegenden Enden eines Designspektrums: Open X-Embodiment ist ein federativer Mega-Corpus aus 33 Forschungslabors über 22 verschiedene Robotertypen zusammengestellt, während DROID ein einheitliches Eingliederungs-Daten-Protokoll ist, das auf einer Franka Panda über Hunderte von echten Szenen gesammelt wurde. Welches Sie verwenden sollten, hängt davon ab, ob Sie sich für Skala-für-Fehrtraining oder Konsistenz-für-Feinabstimmung interessieren.
TL;DR
- Raw Trajektorie Count: Open X-Embodiment gewinnt
1M+ Episoden gegen DROIDs ~76K. - Einheit im Körper: Open X-Einheit gewinnt
22 Robotertypen gegen DROIDs einzelne Franka Panda. - Szenenvielfalt pro Bahn: DROID gewinnt
564 Szenen in 13 Institutionen mit konsistenten Sensoren. - Datenkonsistenz: DROID gewinnt mit einer großen Marge
dieselbe Hardware, dieselbe Kamera-Regierung, das gleiche Episodeformat. - Einfachheit der Ausbildung: DROID gewinnt
keine Verkörperungskreuznormalität erforderlich. - Einfache Ausbildung eines Grundmodells: Open X-Embodiment
darauf wurde RT-X gebaut.
Vergleichstafel Kopf-zu-Kopf
| Attribute | Open X-Embodiment | DROID |
|---|---|---|
| Released | Oct 2023 (Google DeepMind + 33 partners) | Mar 2024 (Stanford / UC Berkeley / TRI + 13 partners) |
| Trajectories | 1,000,000+ episodes | ~76,000 trajectories (~350 hours) |
| Embodiments | 22 robot types (Franka, Google Robot, xArm, WidowX, UR5, etc.) | 1 (Franka Emika Panda with parallel-jaw gripper) |
| Scenes / environments | Mix of labs and uncontrolled environments | 564 scenes across 13 institutions |
| Collection duration | Aggregate of many prior datasets (years) | ~18 months of coordinated collection |
| Cameras | Varies by source dataset | 2x ZED 2 stereo + 1x ZED Mini wrist (consistent) |
| Format | Unified RLDS (TensorFlow Datasets) | RLDS + HDF5; also on HuggingFace / LeRobot |
| Approx. size on disk | Multiple TB (varies by component) | ~1.7 TB raw |
| License | Per-component (mostly CC-BY and Apache-2.0) | MIT + CC-BY-4.0 |
| Reference models | RT-1-X, RT-2-X, OpenVLA, Octo | DROID diffusion policies; used by pi0, OpenVLA fine-tunes |
| Paper | arXiv:2310.08864 | arXiv:2403.12945 |
Die Lücke in der Designphilosophie
Die Open X-Embodiment (OXE) wurde als ein Skalierungsexperiment konzipiert: Wenn wir jeden offenen Manipulationsdatenbestand in ein standardisiertes Format zusammenfassen, können wir eine einzige Politik trainieren, die über 22 verschiedene Roboter übertragen wird? Die Strecken variieren stark in Qualität, Kamera-Rigs, Beleuchtung, Aktionsfrequenzen und Griffkonventionen; deren Verzehr erfordert eine sorgfältige Normalisierung durch das geteilte RLDS-Schema.
DROID nahm den entgegengesetzten Ansatz ein. Anstatt heterogene Daten zu aggregieren, standardisierte DROID eine einzige Hardware-Rig (Franka Panda, zwei ZED 2-Kameras für die Szene, eine ZED Mini auf dem Handgelenk montiert) und versandte sie an 13 Forschungseinrichtungen. Jede Bahn hat die gleiche Beobachtungsform, die gleiche Aktionskonvention und das gleiche Sprach-Annotationsformat. DROID ist dadurch wesentlich einfacher zu trainieren als OXE, und es lohnt sich in sauberen Feintunes.
Wann zu trainieren, auf welchem
Über OXE üben, wenn Sie eine generalistische Kreuzkörperungspolitik aufbauen. RT-X und OpenVLA sind Existenzbeweise dafür, dass OXE-Skala-Übertraining Verhaltensweisen freischaltet, die kein einzelner Körperungsdatensatz kann. Wenn Sie sowieso planen, Ihre eigene Ausführungsform zu optimieren, gibt OXE Ihnen die größte mögliche Vorbereitung.
Fine-Tune auf DROID, wenn Ihre Zielhardware eine Franka Panda oder ein nahezu gleichwertiger 7-DoF-Arm ist, oder Sie eine Diffusionspolitik trainieren und hochwertige Aktionsetiketten mit konsistenter Greifer-Semantik wünschen. DROID ist auch die bessere Wahl, wenn Sie sich um die allgemeine Verallgemeinerung im Wild interessieren.
**Bei der Rechenführung ist das jetzt Standardrezept "OXE Pre-train, DROID Fine-Tune, Task Demo Fine-Tune-2." Das ist das, was [pi0 und mehrere 2025 humanoide Richtlinien]
Berechnung für das Training
OXE-Vor-Ausbildung auf OpenVLA-Skala (7B-Parameter) verwendet ursprünglich 64 A100-GPUs für etwa zwei Wochen. Das ist eine reale Kapitalkosten
Für die Schlussfolgerung ergeben sich in beiden Datensätzen Richtlinien, die auf einer Verbraucher-GPU bequem laufen. Wir empfehlen keine Ausbildung von Grund auf, wenn Sie keinen spezifischen Forschungsgrund haben; die vorgeübten Checkpoints auf HuggingFace sind extrem starke Ausgangspunkt.
Lizenz: Lesen Sie die Kleingedruckte
OXE ist keine einzige Lizenz. Es ist ein Register von Komponenten-Datenmengen, die jeweils ihre eigenen Bedingungen haben. Die meisten Komponenten sind CC-BY-4.0 oder Apache-2.0, was bedeutet, dass Sie kommerzielle Modelle darauf trainieren und Ableitungen an Bord schicken können. Eine Handvoll Komponenten sind nur für Forschung; wenn Sie ein Produkt bauen, prüfen Sie die Komponentenliste nach Ihrer rechtlichen Haltung. DROID ist einfach
Datensatz und Werkzeuggestaltung
Beide Datensätze verwenden RLDS als kanonisches Format und beide werden über das LeRobot-Ökosystem auf HuggingFace Hub gespiegelt. Wenn Sie von Anfang an im Jahr 2026 neu anfangen, ist LeRobot der Weg mit geringstem Widerstand. Unsere [Datenplattform]
Das ist alles , was man wissen muss .
OXE-Aktionsräume sind nicht identisch. Auch im gemeinsamen RLDS-Schema verwenden verschiedene Komponenten verschiedene Aktionskonventionen (End-Effektor vs. Joint, Delta vs. Absolut, verschiedene Griff-Codierungen). Das OXE-Team veröffentlichte eine Normalisierungs-Schicht, aber sie ist nicht perfekt. Planen Sie, echte Ingenieurzeit für die Vorverarbeitung zu verbringen, bevor Sie einen sauberen Traininglauf erhalten.
DROID Handgelenkkamera ist niedrig auflösend. Die Handgelenk ZED Mini liefert 720p Stereo; die Scene Kameras liefern 1080p. Die meisten modernen VLA Architekturen sind sowieso nach unten, aber wenn Sie ein hochauflösendes Wahrnehmungsmodell trainieren, sollten Sie sich der Decke bewusst sein.
Beide haben Klassenunbalance. OXE wird von einer Handvoll großen Komponenten (insbesondere den Google Robot-Daten-Sets) dominiert. DROID wird von einigen Institutionen dominiert, die die meisten Stunden gesammelt haben.
Bewertung: Wie werden die auf jeder der beiden Strategien ausgebildeten Maßnahmen verglichen?
Bei der Veröffentlichung von OpenVLA wurden Kontrollpunkte, die nur auf OXE, DROID und OXE+DROID ausgebildet wurden, in den Ablationsprogrammen eingesetzt. Bei in-Distributure DROID-Aufgaben war der DROID-Checkpoint mit OXE-Only konkurrierend, manchmal besser. Bei der Auswertung außerhalb der Verteilung (unsichtbare Szenen oder Objekte) wurde der OXE-Checkpoint weiter verallgemeinert. Dies ist die empirische Grundlage für das heute standardisierte Rezept "OXE Pre-train, DROID Fine-Tune", und es hat sich bis 2025 und bis 2026 in der Nachbeobachtung gehalten.
Die Lücke ist besonders bei langen Schwanzverhalten deutlich. DROID allein verwaltet Standard-Pick-and-Place zuverlässig, kämpft aber bei allem außerhalb seiner Verteilung. OXE allein verwaltet eine breitere Vielzahl von Aufgaben, produziert aber zerkerere Aktionsspuren, da die zugrunde liegenden Aktionsverteilungen nicht über Komponenten hinweg normalisiert sind.
Speicherung, Streaming und praktische Download
Das vollständige OXE-Korpus ist ein Multi-Terabyte-Operation. Die meisten Teams machen sich keine Sorgen
Was wir empfehlen
Für die meisten Teams, die 2026 eine bereitstellbare Manipulationspolitik erstellen, ist unser Rat: Beginnen Sie mit einem OXE-vorgebildeten OpenVLA oder Pi0-Checkpoint, passen Sie DROID auf, um die Aktionsverteilung zu stabilisieren, und passen Sie dann erneut Ihre eigenen Aufgaben-spezifischen Teleoperationsdaten an. Wenn Sie noch keine Aufgaben-spezifischen Daten haben, können Sie unsere [Custom Data Collection]
Verwandte Mittel
- [Offene Seite des X-Body-Daten-Sets]
- [DROID Datensatz Seite]
- [Vergleich zwischen LIBERO und CALVIN]
- Die Kommission hat die Kommission mit der Einführung eines neuen Systems zur Erreichung der Ziele des Programms "BridgeData vs RoboMimic" (BridgeData vs RoboMimic)
- [Beste Roboter-Lerndatenmengen im Jahr 2026]
- [VLA und Katalog der Politikmodelle]
- [Roboterakademie Tutorials]







