Zurück zu Datasets

Beste Roboternetzungsdatenbücher 2026: Vollständiger Leitfaden

Die 10 besten Roboter-Lerndaten für 2026 sind: Open X-Embodiment, DROID, BridgeData, LIBERO, CALVIN, ALOHA und mehr, mit Maßstab, Lizenz und Anwendungsfällen.

Die Roboter-Lernforschung im Jahr 2026 hat sich auf eine überraschend kleine Datensammlung zusammengestellt, die 90 Prozent der nützlichen Arbeit leistet. Verwenden Sie diese Seite als Startkarte; jeder Datensatz verlinkt zu einer tiefen Tauchseite mit Download-Anweisungen.

Schnelle Auswahl

  • Ausbildungskörper: Öffnetes X-Body
  • Real-World-Fine-Tune: DROID
  • Niedrigkosten-Real-World: BridgeData V2
  • VLA eval: LIBERO
  • ** Langhorizontsprache:** CALVIN
  • Kontrollierte IL-Studie: RoboMimic
  • Bimanual geschickt: ALOHA

Wie wir sie aufgestellt haben

Wir haben fünf Faktoren betrachtet: Skala (Rohtrajektorienzahl und Stundenzahl), Qualität (Sensorkonsistenz, Kamera-Rig Stabilität, Aktionsraum Sauberkeit), Lizenzierung (kommerzielle Freundschaft), Ökosystemunterstützung (Verfügbarkeit auf LeRobot, HuggingFace, offizielle Eval-Scripts, vorgebildete Checkpoints) und Forschungserleganz (Zitatzahl in 2025-2026 Roboter-Learning-Papieren). Kein einzelner Datensatz gewinnt auf allen fünf Achsen, also ist das Ranking vorurteilt auf Datensätze, die tatsächlich nützlich sind in einer Produktion oder Publikation Pipeline heute.

1. Öffnen Sie die X-Behälter

** Warum es an erster Stelle steht:** OXE ist das größte offene Manipulationskorpus in der Existenz (1M+-Episoden in 22 Ausführungen) und ist das Vor-Training-Substrat für RT-1-X, RT-2-X, OpenVLA, Octo und pi0. Wenn Sie eine generalistische Politik wollen, möchten Sie OXE als Ihren Ausgangspunkt. Tauchen Sie tief in unsere [Open X-Embodiment Seite]T0) und sehen Sie unseren [Open X vs DROID]T1) Vergleich für, wann es gegen DROID verwendet wird.

2. DROID

** Warum es Platz zwei:** DROID ist der sauberste realen Datensatz verfügbar. 76K-Trajektoren, 564 Szenen, eine einzige Franka Panda Ausführungsform, einheitliche ZED 2-Kamera-Rig, MIT + CC-BY-4.0. Wenn Sie ein feines Budget haben, geben Sie es hier aus.

3. BridgeData V2

** Warum es dritte ist:** BridgeData V2 ist der zugänglichste realen Datensatz WidowX 250 Hardware-Kosten unter 3K $, und die 60K-Trajektoren des Datensatzes erstrecken sich über 24 Umgebungen mit natürlichen Sprachlabels. Es ist eine Kernkomponente von OXE und ein großartiges Fein-Tune-Ziel für kostengünstige Arm-Deployments. CC-BY-4.0-Lizenz. Siehe die [BridgeData V2 Seite]T3) und unseren [BridgeData vs RoboMimic]T4) Vergleich.

4. LIBERO

** Warum es auf Platz vier ist:** LIBERO ist die de facto VLA-Evaluierungssite geworden. Vier Aufgaben-Suiten, etwa 130 Aufgaben, 6500 Demonstrationen, Robosuite-Simulation. Wenn Sie ein Architekturpapier für die Politik im Jahr 2026 veröffentlichen, werden Sie nach LIBERO-Zahlen gefragt. MIT-Lizenz. Siehe unseren Vergleich LIBERO Datensatz Seite und LIBERO vs. CALVIN.

5. CALVIN

** Warum es fünft ist:** CALVIN ist der einzige weit verbreitete Benchmark, der verknüpfte Langhorizont-Sprachenanweisungen (bis zu 5 pro Ausführung) mit sauberen A/B/C/D-Umgebungssplits testet. 24 Stunden Teleop-Daten. Es ist noch nicht gesättigt im Jahr 2026, was Ihnen etwas darüber sagt, wie hart die verknüpfte Aufgabe wirklich ist. MIT-Lizenz. Siehe die CALVIN-Benchmark-Seite.

6° RoboMimic

** Warum es sechst ist:** RoboMimics PH / MH / MG Demonstrationsqualitätssplitts sind immer noch der Goldstandard für die Untersuchung der Robustheit im Nachahmungslearning. Fünf Robosuite-Aufgaben mit zunehmender Schwierigkeit. Nicht ein Einsatzdatensatz, sondern eine unverzichtbare Diagnose. MIT-Lizenz. Siehe die RoboMimic Datensatz Seite.

7. ALOHA

** Warum es siebte ist:** ALOHA war Pionier der billigen zweibrochten Teleoperation und bleibt die Standardplattform für feinen Korn geschicktes Manipulationsforschung. Die offiziellen ALOHA-Datenmengen sowie die Mobile ALOHA-Erweiterungen fahren weiterhin die zweibrochten VLA-Arbeit voran. Apache / MIT. Siehe die ALOHA-Datenmenge-Seite und unseren ALOHA-Leitfaden.

8. RoboNet

** Warum es acht ist:** RoboNet's 15M-Video-Frame auf 7 Roboterplattformen machten es zum ursprünglichen Kreuzkörperdaten-Set. Es wird für die meisten Trainingszwecke von OXE ersetzt, bleibt aber wertvoll für nur Video-Lernen und Transferstudien.

9. MimicGen

** Warum es auf Platz neun ist:** MimicGen ist weniger ein Datensatz als ein Datenerationssystem: Es synthetisiert 50K+ Demonstrationen aus ~ 200 menschlichen Samen. Die gebündelten simulierten Aufgaben-Suiten sind nützlich für die Forschung imitierender Lern, und die MimicGen-Pipeline selbst wird zum Standard für die Erweiterung der realen Sammlung. Apache-2.0.

10. LeRobot Hub

** Warum es zehnth ist:** LeRobot ist nicht ein einzelner Datensatz, sondern eine Verteilungsschicht eine einheitliche PyTorch-Schnittstelle über DROID, ALOHA, BridgeData, Open X Komponenten, SO-100, und mehr. Für praktische 2026 Workflows ist LeRobot der einfachste Weg, um alle oben genannten Datensätze zu konsumieren. Apache-2.0.

Zusammenfassende Tabelle

Rank Dataset Domain Scale Best for License
1 Open X-Embodiment Real (mixed) 1M+ episodes Pretraining Per-component
2 DROID Real (Franka) ~76K trajs Real fine-tune MIT / CC-BY
3 BridgeData V2 Real (WidowX) ~60K trajs Low-cost real CC-BY-4.0
4 LIBERO Sim (Robosuite) ~130 tasks VLA eval MIT
5 CALVIN Sim (PyBullet) 24 hrs teleop Long-horizon MIT
6 RoboMimic Sim 5 tasks, PH/MH/MG IL study MIT
7 ALOHA Real (bimanual) Task-specific Dexterous MIT / Apache
8 RoboNet Real (mixed) 15M frames Video / transfer MIT
9 MimicGen Sim 50K+ synth Data augmentation Apache-2.0
10 LeRobot Hub Distribution Hundreds of datasets Tooling Apache-2.0

Das moderne Trainingrezept

Im Jahr 2026 besteht das modelle Rezept für den Aufbau einer bereitstellbaren Manipulationspolitik aus drei Stufen. Stufe eins: Vor-Train (oder Start von einem vorgeübten Checkpoint) Open X-Embodiment. Stufe zwei: Mitteltrain auf DROID oder BridgeData zur Verankerung von Aktionsverteilungen in der realen Welt. Stufe drei: Fein-Tuning auf Aufgaben-spezifische Teleoperationsdaten, die auf Ihrer Zielhardware gesammelt wurden. Die Kommission hat die Kommission mit der Kommission über die Durchführung der Richtlinie über die Verringerung der Verletzung von Verletzungen und der Verletzung von Verletzungen in den Mitgliedstaaten beschlossen.

Die Benchmarks passen in dieses Rezept als diagnostics. LIBERO und CALVIN sagen Ihnen, ob Ihre Phase-one + Phase-two-Politik sich verallgemeint, bevor Sie Sammelgeld für Phase drei ausgeben. RoboMimic PH/MH/MG sagt Ihnen, ob Ihre Politik robust ist, um die Heterogenität zu demonstrieren. Keiner dieser Benchmarks sind Produktionsproxy behandeln hohe LIBERO-Score nicht als Bereitschaft zum Einsatz.

Was sich zwischen 2024 und 2026 verändert hat

Drei Dinge haben die Datensatzlandschaft umgestaltet. Erstens ging Open X-Embodiment von einem "interessanten Experiment" zu einem "unvermeidlichen Vor-Training-Corpus" nach der Öffentlichkeit der RT-X- und OpenVLA-Checkpoints. Zweitens wurde DROID von einer Datensatzveröffentlichung zu einem Standard die ZED-2-on-Franka-Rig die de facto-Vorlage für die neue Datenerhebung in mehreren Forschungslabors. Drittens verwandelte das LeRobot-Ökosystem den Datensatzverbrauch von einem maßgeschneiderten Ingenieurprojekt in eine PyTorch-freundliche Ware, was die Barriere für das Training auf mehreren Datensätzen gleichzeitig signifikant senkte.

Die Datenmengen, die Boden verloren haben, waren die älteren Single-Task-Simulated-Benchmarks (Meta-World, FrankaKitchen). Sie werden immer noch zitiert, aber sie werden nicht als primäre Bewertungsziele in den Papieren angezeigt, die uns interessieren. RoboNet ist ähnlich in Abbau als ein training Corpus, obwohl es für videobasierte Methoden immer noch wichtig ist. Auf der realen Seite hielt ALOHA ihren Stand, weil zweimannuale Daten noch knapp und wertvoll sind.

Datensätze, die wir nicht enthalten haben (und warum)

Wir haben ARIO, RH20T, AutoRT-Daten und Mobile ALOHA-Erweiterungen in Betracht gezogen. Alle sind vielversprechend, aber entweder zu neu, zu schmal oder zu verbunden mit der Hardware eines einzelnen Labors, um eine zuverlässige Empfehlung für den allgemeinen Einsatz in 2026 zu sein. Wenn Ihre Forschungsfrage speziell von einer dieser profitiert, benutzen Sie sie aber keiner von ihnen verdrängte unsere Top-Ten.

Wie Sie Ihre eigenen ergänzenden Daten sammeln

Jedes Produktionsroboterteam benötigt schließlich aufgabe-spezifische Teleoperationsdaten, die offene Datensätze nicht liefern können. Hier passt das Robotics Center of Silicon Valley ein. Unsere [Datendienste] T14) führen von unserem San Francisco Labor benutzerdefinierte Datenerhebungskampagnen auf Franka, WidowX, ALOHA und OpenArm-Plattformen durch. Typische Kampagnen erzeugen in 2-6 Wochen 500-5000 qualitativ hochwertige Flugbahnen pro Aufgabe, die in einem RLDS- oder LeRobot-kompatiblen Format geliefert werden.

Wenn Sie die Sammelfähigkeit im eigenen Haus aufbauen möchten, verkauft unser Store die gleichen Roboterarme und Teleoperations-Rigs, die in DROID, BridgeData und ALOHA verwendet werden. Und unsere Datenplattform nimmt und etikettiert die Flugbahnen mit demselben Schema, das die offenen Datensätze verwenden, so dass Ihre Daten sauber mit OXE und DROID im Training mischen.

Häufig gestellte Fragen

Mit welchem Roboter-Lerndatensatz sollte ich 2026 beginnen?

Beginnen Sie mit einem Open-X-Embodiment-vorgebildeten Checkpoint (OpenVLA oder pi0) und tunen Sie DROID auf.

Ist Open X-Embodiment für kommerzielle Zwecke kostenlos?

OXE ist ein Register von Komponentendatensätzen mit je Komponentenlizenzen. Die meisten Komponenten sind CC-BY-4.0 oder Apache-2.0, aber einige sind nur für Forschung. Überprüfen Sie die Komponentenliste, bevor Sie eine kommerzielle Richtlinie versenden.

Was ist der Unterschied zwischen LIBERO und CALVIN?

LIBERO ist ein lebenslanges Lern-Benchmark auf Robosuite mit vier einzelnen Aufgaben-Suiten; es ist die Standard für VLA-Evaluierung. CALVIN ist ein langhorizont-Benchmark mit vier Umgebungen und Ketten von fünf Anweisungen; es ist der Goldstandard für Zusammensetzungstests. Siehe unseren Detailsvergleich.

Wie viel Rechen brauche ich?

Die vollständige OXE-Vorbildung auf OpenVLA-Skala verwendet ungefähr 64 A100s für zwei Wochen.

Kann ich meinen eigenen Roboterdatensatz sammeln?

Ja. Offene Datensätze sind am besten als Vor-Training-Corpores; für die Bereitstellung benötigen Sie Aufgaben-spezifische Daten auf Ihrer Zielhardware.

Verwandte Mittel

  • [LIBERO vs. CALVIN Vergleich]
  • [Offene X-Body gegen DROID]
  • [BridgeData vs RoboMimic]
  • [Alle Datensätze Katalog]
  • [VLA und politische Modelle]
  • [Benchmarks Hub]
  • [Forschungsberichte]
  • [Robotikakademie]
  • [Shop Roboter Hardware]