Zurück zu Datasets

Die Langzeiten der Sprache sind durch Roboter manipuliert

Entdecken Sie CALVIN: 24 Stunden Teleop in 34 Aufgaben in 4 Umgebungen mit natürlichen Sprachetiketten.

Ein 24-Stunden-Daten-Set für die Manipulation von Tabellen auf vier Umgebungen mit vollständiger natürlicher Sprache der kanonische Benchmark für die Kompositionsanweisung nach Roboternatmen.

TL;DR

Metric Value
Task count 34 distinct subtasks, 5-instruction evaluation chains
Robots Franka Emika Panda (PyBullet simulation)
Modalities RGB static + gripper cameras, depth, proprioception, language
License MIT
Size ~24 hours of teleop play data (~166 GB uncompressed)
Environments A, B, C, D (different textures, lighting, object layouts)

Was ist Calvin?

CALVIN (Composing Actions from Language and Vision) wurde von der Universität Freiburg veröffentlicht, um in langen Zeithorizonten sprachlich bedingte Roboterpolitik zu stress-testend zu gestalten. Es nimmt eine andere Datenerhebungsphilosophie von Benchmarks im Clip-Stil: Anstatt eine Demonstration pro gekennzeichneten Aufgabe aufzunehmen, nahm CALVIN ~24 Stunden unbestimmtes teleoperatives "Spiel" auf einem Franka Emika Panda auf und segmentierte und markierte diese Strecken dann rückwirkend mit natürlicher Sprache. Dies erzeugt sowohl ein dichtes Imitationslernsignal als auch ein multitasking-Sprachkorpus mit Hunderten verschiedener englischer Phrasen pro Fähigkeit.

Die Benchmark-Liste enthält vier Umgebungen (A, B, C, D), die die gleiche Tabellegeometrie teilen, aber sich in Texturen, Beleuchtung und Arrangements von artikulierten Objekten unterscheiden: eine Schiebetür, eine Schublade, ein Griff, Blöcke in verschiedenen Farben und ein LED-Taste.

CALVIN ist der Referenzwert, der für die Bezeichnung "langen Horizont" verwendet wird, da das offizielle Bewertungsprotokoll fünf aufeinanderfolgende Anweisungen enthält und die Implementierung nur dann als erfolgreich bezeichnet, wenn alle fünf Teilarbeiten in Ordnung abgeschlossen sind. Dieser Zusammenschluss macht die Sättigung von CALVIN-Zahlen viel schwieriger als Single-Task-Benchmarks, weshalb HULC, RT-2, GR-1 und RoboFlamingo alle darüber berichten.

Wie man herunterlädt und lädt

# Clone the benchmark
git clone --recursive https://github.com/mees/calvin.git
cd calvin && sh install.sh

# Download the full ABCD split (~166 GB)
cd dataset && sh download_data.sh ABCD

# Iterate demos in Python
from calvin_env.envs.play_table_env import get_env
from calvin_agent.datasets.npz_dataset import NpzDataset
d = NpzDataset(data_dir='dataset/task_ABCD_D/training')
print(d[0]['rgb_static'].shape, d[0]['language']['ann'])

Für die Ausbildungsstufen umwandeln die meisten Teams CALVIN in RLDS- oder LeRobot-Format, damit sie einen Datenauflader mit Open X-Embodiment und BridgeData v2 teilen können.

Häufige Anwendungsfälle und Paare

  • Sprachbedingte Politiken. HULC, HULC++ und GR-1 veröffentlichen alle CALVIN-Nummern; es ist der kürzeste Weg, um eine neue sprachbedingte Politik zu demonstrieren.
  • VLA-Feinabstimmung. RoboFlamingo, RT-2 und OpenVLA-Varianten tunen auf CALVIN, um die Sprachenbereitung zu validieren; die Genauigkeit der Sequenzkette ist ein guter Proxy für die Folge von VLA-Anweisungen.
  • Latent Planning / World Models. Die langen, nicht gekennzeichneten Spieldaten werden häufig verwendet, um Latent Plan Generatoren (LATMO, SkillMimic) vor der Abwicklung von Aufgaben vorzubilden.
  • Sim-to-Real-Validation. Die Vier-Umgebung-Splittung ermöglicht es den Forschern, Textur- und Layout-Veränderungen von der tatsächlichen Manipulationsfähigkeit zu trennen.

Benchmarks & Leaderboards

Die gemeldete Metrik ist die durchschnittliche Länge erfolgreicher Anleitungsketten (0 bis 5). Siehe Papiere mit CALVIN-Code-Leaderboard und offizielle Projektseite für den aktuellen Stand der Technik.