Zurück zu Datasets

Öffnen Sie X-Bodyment vs DROID: Welchen Roboter-Datensatz sollten Sie verwenden?

Öffnen Sie X-Embodiment vs DROID: Trajektorienskala, Ausführungsformen, Datensatz, Lizenz und Schulungsrechnung im Vergleich. Wählen Sie den richtigen Basismodell-Roboter-Datenbestand im Jahr 2026.

Open X-Embodiment und DROID sind die beiden größten offenen Roboter-Lerndatenmengen im Jahr 2026. Sie liegen an den gegenüberliegenden Enden eines Designspektrums: Open X-Embodiment ist ein federativer Mega-Corpus aus 33 Forschungslabors über 22 verschiedene Robotertypen zusammengestellt, während DROID ein einheitliches Eingliederungs-Daten-Protokoll ist, das auf einer Franka Panda über Hunderte von echten Szenen gesammelt wurde. Welches Sie verwenden sollten, hängt davon ab, ob Sie sich für Skala-für-Fehrtraining oder Konsistenz-für-Feinabstimmung interessieren.

TL;DR

  • Raw Trajektorie Count: Open X-Embodiment gewinnt 1M+ Episoden gegen DROIDs ~76K.
  • Einheit im Körper: Open X-Einheit gewinnt 22 Robotertypen gegen DROIDs einzelne Franka Panda.
  • Szenenvielfalt pro Bahn: DROID gewinnt 564 Szenen in 13 Institutionen mit konsistenten Sensoren.
  • Datenkonsistenz: DROID gewinnt mit einer großen Marge dieselbe Hardware, dieselbe Kamera-Regierung, das gleiche Episodeformat.
  • Einfachheit der Ausbildung: DROID gewinnt keine Verkörperungskreuznormalität erforderlich.
  • Einfache Ausbildung eines Grundmodells: Open X-Embodiment darauf wurde RT-X gebaut.

Vergleichstafel Kopf-zu-Kopf

Attribute Open X-Embodiment DROID
Released Oct 2023 (Google DeepMind + 33 partners) Mar 2024 (Stanford / UC Berkeley / TRI + 13 partners)
Trajectories 1,000,000+ episodes ~76,000 trajectories (~350 hours)
Embodiments 22 robot types (Franka, Google Robot, xArm, WidowX, UR5, etc.) 1 (Franka Emika Panda with parallel-jaw gripper)
Scenes / environments Mix of labs and uncontrolled environments 564 scenes across 13 institutions
Collection duration Aggregate of many prior datasets (years) ~18 months of coordinated collection
Cameras Varies by source dataset 2x ZED 2 stereo + 1x ZED Mini wrist (consistent)
Format Unified RLDS (TensorFlow Datasets) RLDS + HDF5; also on HuggingFace / LeRobot
Approx. size on disk Multiple TB (varies by component) ~1.7 TB raw
License Per-component (mostly CC-BY and Apache-2.0) MIT + CC-BY-4.0
Reference models RT-1-X, RT-2-X, OpenVLA, Octo DROID diffusion policies; used by pi0, OpenVLA fine-tunes
Paper arXiv:2310.08864 arXiv:2403.12945

Die Lücke in der Designphilosophie

Die Open X-Embodiment (OXE) wurde als ein Skalierungsexperiment konzipiert: Wenn wir jeden offenen Manipulationsdatenbestand in ein standardisiertes Format zusammenfassen, können wir eine einzige Politik trainieren, die über 22 verschiedene Roboter übertragen wird? Die Strecken variieren stark in Qualität, Kamera-Rigs, Beleuchtung, Aktionsfrequenzen und Griffkonventionen; deren Verzehr erfordert eine sorgfältige Normalisierung durch das geteilte RLDS-Schema.

DROID nahm den entgegengesetzten Ansatz ein. Anstatt heterogene Daten zu aggregieren, standardisierte DROID eine einzige Hardware-Rig (Franka Panda, zwei ZED 2-Kameras für die Szene, eine ZED Mini auf dem Handgelenk montiert) und versandte sie an 13 Forschungseinrichtungen. Jede Bahn hat die gleiche Beobachtungsform, die gleiche Aktionskonvention und das gleiche Sprach-Annotationsformat. DROID ist dadurch wesentlich einfacher zu trainieren als OXE, und es lohnt sich in sauberen Feintunes.

Wann zu trainieren, auf welchem

Über OXE üben, wenn Sie eine generalistische Kreuzkörperungspolitik aufbauen. RT-X und OpenVLA sind Existenzbeweise dafür, dass OXE-Skala-Übertraining Verhaltensweisen freischaltet, die kein einzelner Körperungsdatensatz kann. Wenn Sie sowieso planen, Ihre eigene Ausführungsform zu optimieren, gibt OXE Ihnen die größte mögliche Vorbereitung.

Fine-Tune auf DROID, wenn Ihre Zielhardware eine Franka Panda oder ein nahezu gleichwertiger 7-DoF-Arm ist, oder Sie eine Diffusionspolitik trainieren und hochwertige Aktionsetiketten mit konsistenter Greifer-Semantik wünschen. DROID ist auch die bessere Wahl, wenn Sie sich um die allgemeine Verallgemeinerung im Wild interessieren.

**Bei der Rechenführung ist das jetzt Standardrezept "OXE Pre-train, DROID Fine-Tune, Task Demo Fine-Tune-2." Das ist das, was [pi0 und mehrere 2025 humanoide Richtlinien] T4) verwendet hat, und es setzt den Standard auch im Jahr 2026 fort.

Berechnung für das Training

OXE-Vor-Ausbildung auf OpenVLA-Skala (7B-Parameter) verwendet ursprünglich 64 A100-GPUs für etwa zwei Wochen. Das ist eine reale Kapitalkosten auf der Ordnung von 100K $ auf der öffentlichen Cloud. Wenn Sie nur einen vor-Ausbildung Checkpoint fein tunen wollen, ist ein einziger 8xA100 oder 8xH100-Knoten für einen oder zwei Tage typisch. DROID-Fine-Tunes können auf 1 bis 4 GPUs durchgeführt werden, da der Datensatz viel kleiner ist; viele Teams trainieren vollständige DROID-Difusionsrichtlinien auf einer einzigen 8x3090-Arbeitsstation.

Für die Schlussfolgerung ergeben sich in beiden Datensätzen Richtlinien, die auf einer Verbraucher-GPU bequem laufen. Wir empfehlen keine Ausbildung von Grund auf, wenn Sie keinen spezifischen Forschungsgrund haben; die vorgeübten Checkpoints auf HuggingFace sind extrem starke Ausgangspunkt.

Lizenz: Lesen Sie die Kleingedruckte

OXE ist keine einzige Lizenz. Es ist ein Register von Komponenten-Datenmengen, die jeweils ihre eigenen Bedingungen haben. Die meisten Komponenten sind CC-BY-4.0 oder Apache-2.0, was bedeutet, dass Sie kommerzielle Modelle darauf trainieren und Ableitungen an Bord schicken können. Eine Handvoll Komponenten sind nur für Forschung; wenn Sie ein Produkt bauen, prüfen Sie die Komponentenliste nach Ihrer rechtlichen Haltung. DROID ist einfach MIT + CC-BY-4.0 auf den Daten, zulässig für kommerzielle Verwendung, mit Zuteilung. Wenn Lizenzreinigkeit für Ihre Bereitstellung wichtig ist, ist DROID die sichere Wahl.

Datensatz und Werkzeuggestaltung

Beide Datensätze verwenden RLDS als kanonisches Format und beide werden über das LeRobot-Ökosystem auf HuggingFace Hub gespiegelt. Wenn Sie von Anfang an im Jahr 2026 neu anfangen, ist LeRobot der Weg mit geringstem Widerstand. Unsere [Datenplattform]T5) nimmt beide Formate ein und unterstützt auch die Umwandlung Ihrer eigenen gesammelten Demo in OXE-kompatible RLDS.

Das ist alles , was man wissen muss .

OXE-Aktionsräume sind nicht identisch. Auch im gemeinsamen RLDS-Schema verwenden verschiedene Komponenten verschiedene Aktionskonventionen (End-Effektor vs. Joint, Delta vs. Absolut, verschiedene Griff-Codierungen). Das OXE-Team veröffentlichte eine Normalisierungs-Schicht, aber sie ist nicht perfekt. Planen Sie, echte Ingenieurzeit für die Vorverarbeitung zu verbringen, bevor Sie einen sauberen Traininglauf erhalten.

DROID Handgelenkkamera ist niedrig auflösend. Die Handgelenk ZED Mini liefert 720p Stereo; die Scene Kameras liefern 1080p. Die meisten modernen VLA Architekturen sind sowieso nach unten, aber wenn Sie ein hochauflösendes Wahrnehmungsmodell trainieren, sollten Sie sich der Decke bewusst sein.

Beide haben Klassenunbalance. OXE wird von einer Handvoll großen Komponenten (insbesondere den Google Robot-Daten-Sets) dominiert. DROID wird von einigen Institutionen dominiert, die die meisten Stunden gesammelt haben.

Bewertung: Wie werden die auf jeder der beiden Strategien ausgebildeten Maßnahmen verglichen?

Bei der Veröffentlichung von OpenVLA wurden Kontrollpunkte, die nur auf OXE, DROID und OXE+DROID ausgebildet wurden, in den Ablationsprogrammen eingesetzt. Bei in-Distributure DROID-Aufgaben war der DROID-Checkpoint mit OXE-Only konkurrierend, manchmal besser. Bei der Auswertung außerhalb der Verteilung (unsichtbare Szenen oder Objekte) wurde der OXE-Checkpoint weiter verallgemeinert. Dies ist die empirische Grundlage für das heute standardisierte Rezept "OXE Pre-train, DROID Fine-Tune", und es hat sich bis 2025 und bis 2026 in der Nachbeobachtung gehalten.

Die Lücke ist besonders bei langen Schwanzverhalten deutlich. DROID allein verwaltet Standard-Pick-and-Place zuverlässig, kämpft aber bei allem außerhalb seiner Verteilung. OXE allein verwaltet eine breitere Vielzahl von Aufgaben, produziert aber zerkerere Aktionsspuren, da die zugrunde liegenden Aktionsverteilungen nicht über Komponenten hinweg normalisiert sind.

Speicherung, Streaming und praktische Download

Das vollständige OXE-Korpus ist ein Multi-Terabyte-Operation. Die meisten Teams machen sich keine Sorgen sie streamen die Komponenten, die sie sich um sie kümmern, über TFDS oder verwenden den HuggingFace Spiegel mit Streaming-Modus. DROID ist bei ~1,7 TB Roh mehr verwaltbar. Wenn Sie an einer kleineren Anlage arbeiten, verteilt HuggingFace LeRobot einen vorverarbeiteten 100-Trajektorie DROID-Untersatz (DROID-100), der hervorragend für Prototypenleitungen ist, bevor Sie sich zur vollen Zugführung verpflichtet haben.

Was wir empfehlen

Für die meisten Teams, die 2026 eine bereitstellbare Manipulationspolitik erstellen, ist unser Rat: Beginnen Sie mit einem OXE-vorgebildeten OpenVLA oder Pi0-Checkpoint, passen Sie DROID auf, um die Aktionsverteilung zu stabilisieren, und passen Sie dann erneut Ihre eigenen Aufgaben-spezifischen Teleoperationsdaten an. Wenn Sie noch keine Aufgaben-spezifischen Daten haben, können Sie unsere [Custom Data Collection]T6) in wenigen Wochen bootstrap. Wenn Sie noch Hardware wählen, ist die Franka Panda die offensichtliche Wahl für DROID-Kompatibilität, aber WidowX-Arme funktionieren auch gut, wenn Sie sich auf BridgeData verlassen wollen.

Verwandte Mittel

  • [Offene Seite des X-Body-Daten-Sets]
  • [DROID Datensatz Seite]
  • [Vergleich zwischen LIBERO und CALVIN]
  • Die Kommission hat die Kommission mit der Einführung eines neuen Systems zur Erreichung der Ziele des Programms "BridgeData vs RoboMimic" (BridgeData vs RoboMimic)
  • [Beste Roboter-Lerndatenmengen im Jahr 2026]
  • [VLA und Katalog der Politikmodelle]
  • [Roboterakademie Tutorials]