Datasetsに戻る

カルビン: 長期間の言語によるロボット操作

カーリンを 24 時間 探検する 自然言語のラベルを付けている 4 つの環境で 34 つのタスクを介して 24 時間 遠隔操作をします 15 分で HULC をダウンロードし,細かく調節し,ベンチマークします

機械政策の構成指示の標準基準である 完全な自然言語のラベルを付いた24時間,四環境のテーブルタップ操作データセット

TL;DR

Metric Value
Task count 34 distinct subtasks, 5-instruction evaluation chains
Robots Franka Emika Panda (PyBullet simulation)
Modalities RGB static + gripper cameras, depth, proprioception, language
License MIT
Size ~24 hours of teleop play data (~166 GB uncompressed)
Environments A, B, C, D (different textures, lighting, object layouts)

カルビンとは何か?

フライブルグ大学がリリースしたCALVIN (言語とビジョンから行動を構成) は,長期にわたる言語条件によるロボット政策をストレステストするために公開されました. クラップスタイルベンチマークから異なるデータ収集哲学を取り入れます. レーベル付けされたタスクごとに1つのデモを記録する代わりに,カルヴィンはフランカ・エミカ・パンダで24時間ほどの非方向性テレ操作された"プレイ"を記録し,その後,それらの軌道を自然言語で遡及的に分割し,集団レーベル付けしました. これは密集な模倣学習信号と 技能ごとに数百の異なる英語のフレーズを 複数作業言語で作るものです

基準値は,同じテーブルテーブルジオメトリを共有する4つの環境 (A,B,C,D) を構成しているが,構造,照明,並べ替えの異なる物体である. スライディングドア,ドラフト,ハンドル,さまざまな色のブロック,LEDボタンを構成する.四文字のトレーニング/評価分割 (ABCD→D, ABC→D, D→D) は,研究者が環境一般化を純粋な模倣性能から隔離できるようにした.

公式評価プロトコルは5つの連続指示を連鎖し,すべての5つのサブタスクが順番に完了した場合にのみ,展開が成功するとカウントされるため,CALVINは,紙が"長視線言語のフォロー"を主張するたびに選択基準です. 複合故障モードは 単作業基準よりも カルビン数を飽和するのがはるかに難しいので HULC,RT-2,GR-1,RoboFlamingoはすべて報告しています

ダウンロードと読み込み方法

# Clone the benchmark
git clone --recursive https://github.com/mees/calvin.git
cd calvin && sh install.sh

# Download the full ABCD split (~166 GB)
cd dataset && sh download_data.sh ABCD

# Iterate demos in Python
from calvin_env.envs.play_table_env import get_env
from calvin_agent.datasets.npz_dataset import NpzDataset
d = NpzDataset(data_dir='dataset/task_ABCD_D/training')
print(d[0]['rgb_static'].shape, d[0]['language']['ann'])

規模でのトレーニングでは,ほとんどのチームはCALVINを RLDSまたはLeRobotフォーマットに変換し,Open X-EmbodimentおよびBridgeData v2でデータロードを共有できます.

共通用例&ペアリング

  • 言語条件の政策* HULC,HULC++,GR-1は全てCALVIN番号を公開し,新しい言語条件の政策作品を示すための最短の道です.
  • **VLAの微調整.**CALVINで RoboFlamingo,RT-2,OpenVLAの微調整をすることで,言語の基礎を検証できます. シーケンスチェーンの精度はVLAの指示をフォローする良い代理です.
  • ** 潜伏計画/世界モデル.** 長期にわたってラベルが付けられていないプレイデータは,下流作業専門化前に潜伏計画生成器 (LATMO,SkillMimic) を予備訓練するためによく使用されます.
  • シムからリアルに検証する. 4つの環境の分割により,研究者は実際の操作能力から質感とレイアウトシフトを分離することができます.

ランキングとランキング

報告されたメトリックは,成功した指導チェーン (0~5) の平均長さである. 現在の最新状態については, CALVINコード付きの論文ランキングボード公式プロジェクトサイト を参照してください.