Robomimic: Benchmark für das Lernen von kanonischen Imitationen
Erforschen Sie Robomimic: 6 Aufgaben-Suiten, 1000+ Demos pro Aufgabe, basierend auf Robosuite und MuJoCo. Laden Sie, reproduzieren Sie BC-RNN und Basislinien für Diffusionpolitik und benchmark in 1 Nachmittag.
Ein Praktikerführer zur Robomimik
TL;DR
| Metric | Value |
|---|---|
| Task suites | 6 (Lift, Can, Square, Transport, ToolHang, NutAssembly) |
| Robots | Franka Emika Panda, Rethink Sawyer (simulated in robosuite) |
| Modalities | Low-dim state, RGB (agent + wrist camera), object poses |
| License | MIT |
| Size | ~1,000 demonstrations per task × 3 data qualities (PH, MH, MG) |
| Simulator | robosuite (MuJoCo) |
Was ist Robomimic?
Robomimic wurde von der ARISE Initiative an Stanford (Ajay Mandlekar, Danfei Xu, Josiah Wong, et al.) als eine rigorose empirische Studie darüber eingeführt, was tatsächlich im Imitierungslernen für Robotermanipulation funktioniert. Das Team sammelte drei Versionen der Demonstrationen jeder Aufgabe
Die Softwareveröffentlichung, die das Papier
Robomimic ist auch der direkte intellektuelle Vorfahren von LIBERO
Wie man herunterlädt und lädt
Robomimic sendet ein einzeitiges Download-Skript, das die kanonischen HDF5-Dateien aus dem Spiegel von Stanford abholt:
# Install the framework
pip install robomimic
# Download all task suites at PH, MH, and MG quality
python -m robomimic.scripts.download_datasets \
--tasks lift can square transport tool_hang nut_assembly \
--dataset_types ph mh mg \
--hdf5_types image low_dim
# Train a Diffusion Policy baseline
python -m robomimic.scripts.train \
--config configs/diffusion_policy.json \
--dataset datasets/square/ph/low_dim_v141.hdf5
# Evaluate the trained checkpoint in robosuite
python -m robomimic.scripts.run_trained_agent \
--agent trained_models/.../model_epoch_2000.pth \
--n_rollouts 50 --video_path eval.mp4
Das HDF5-Format beschreibt sich selbst
Häufige Anwendungsfälle und Modellpaarungen
- BC-Basislinien. BC-RNN und BC-Transformer auf Robomimic sind die kanonischen Basislinien, die jedes neue Imitationspapier schlagen muss.
- Diffusion Policy Evaluation. Cheng Chi's Diffusion Policy Paper verwendet Robomimic als primäres Benchmark, und jedes Nachschlagepapier hält die gleiche Aufgabenliste.
- Offline-RL-Vergleiche. Die MG (maschinengenerierte) Split ist einer der wenigen echten Roboternmanipulation Datenmengen, die speziell für Offline-RL-Forschung entwickelt wurden.
- Sim-to-Real-Lehrplan. Da die Aufgaben auf MuJoCo basieren, starten Teams oft die Real-Roboter-Franka-Politiken auf Robomimic Lift oder Square, bevor sie auf reale Daten umsteigen.
Benchmarks & Leaderboards
Die Erfolgsrate von Robomimic betrug durchschnittlich über 50 Einführungsprozesse pro Aufgabe. Die Diffusion Policy berichtet über 100% auf Lift und Can, 95%+ auf Square und 80%+ auf Transport und ToolHang aus dem PH-Teil. Siehe die Referenznummern Papiere mit Code Robomimic Entry, die [offizielle Projektseite]
Technisches tiefgreifendes Tauchen: PH vs. MH vs. MG-Daten
Die nützlichste Designentscheidung von Robomimic ist, dass jede Aufgabe in drei Datenqualitätsregimes verarbeitet wird. **Proficient-Human (PH) ** ist 200 Demonstrationen eines einzigen Experten-Teleoperators, der umfangreiche Praxis in der Aufgabe hatte. **Mixed-Human (MH) ** ist 300 Demonstrationen, die in sechs Teleoperatoren unterschiedlicher Fähigkeit aufgeteilt sind, was eine realistische Heterogenität in Trajektörform, Erfolgsrate und Zögerung einführt. **Machin-Generated (MG) ** ist 300 Einführung von einem suboptimalen SAC-Agent, der speziell zur Untersuchung von offline-RL unter suboptimalen Verhaltens-Politik-Annahmen verwendet wird.
Die empirische Punchline aus dem CoRL 2021 Papier ist, dass BC-RNN auf PH Daten übereinstimmt oder übertrifft jede offline RL Methode, die auf jeder Aufgabe getestet wurde. Auf MH-Daten schrumpft die Lücke, aber BC gewinnt immer noch. Nur auf MG-Daten übertreffen offline RL-Methoden (spezifisch CQL und IRIS) BC, was mit der theoretischen Erwartung übereinstimmt, dass BC nur so gut sein kann wie seine Daten. Deshalb werden in der Diffusionspolitik und in den Nachfolgendarbeiten fast immer die PH- und MH-Zahlen zuerst berichtet.
Ein weiteres subtiles, aber wichtiges Detail ist die Beobachtungsspaltung
Bekannte Einschränkungen
- Sie sind nur Simulation. Alle Daten werden von MuJoCo erzeugt.
- Klein Abdeckung pro Aufgabe. 200-300 Demo pro Aufgabe ist nach modernen VLA-Standards klein.
- Keine Sprachanweisungen. Aufgaben werden durch ID und nicht durch natürliche Sprache identifiziert, daher kann Robomimic nicht direkt Sprachbedingungen ausbilden.
- Franka / Sawyer nur. Cross-embodiment Transfer erfordert die Kombination mit Open X-embodiment oder ähnlichem.
FAQ
Ist Robomimic jetzt abgelaufen, da LIBERO existiert? Nein
** Kann ich Robomimic als Trainingsrahmen ohne die Datensätze verwenden?** Ja
Welche ist die schnellste Möglichkeit, einen neuen Algorithmus zu erstellen? Laufen Sie BC-RNN und Diffusion Policy auf den PH-Daten für alle 6 Aufgaben mit den versandten Konfigurationen aus. Das dauert ~ 2 GPU-Tage und gibt Ihnen einen reproduzierbaren Vergleichspunkt.







