Datasetsに戻る

LIBERO vs CALVIN: ロボット学習ベンチマーク比較2026

LIBERO vs CALVIN 2026:タスク・スーツ,デモ,言語コンディショニング,実施形態,ライセンス比較.生涯または長期ロボット学習のための適切な基準を選択します.

LIBEROとCALVINは現代ロボット学習における最も広く引用されている模擬基準のうちの2つである.両者は言語条件による操作をターゲットとするが,非常に異なる研究目的で設計された. 2026年に数字を報告する方法を選択している場合は,このガイドは,規模,構造,言語,実施形態,計算,ライセンス等を直接比較します.

TL;DR

  • 生涯学習/継続的な学習: LIBEROはデフォルトで 4つのタスクセットで知識転送評価のために明示的に構築されました.
  • 長視線言語連鎖: カルビンが勝利する 独自の販売ポイントは,1つの展開で最大5つの言語指示のシーケンスを評価することです
  • VLAモデルベンチマーク: LIBEROは最近の研究 (OpenVLA, [pi0, Octo](T2)) でより一般的です.
  • 環境分割一般化: カルビンが勝利する 視覚的に異なる環境 (A,B,C,D) はクリーンな電車/テストプロトコルを出す.
  • 本地での操作が簡単: LIBEROは軽く Robosuite + MuJoCo, T0. CALVINは専用のPyBulletベースのシミュレーターを搭載しています.

一目惚れで

Attribute LIBERO CALVIN
First release 2023 (NeurIPS D&B track) 2022 (RA-L)
Primary goal Lifelong learning + imitation / VLA eval Long-horizon language-conditioned manipulation
Task suites 4 suites: Spatial, Object, Goal, LIBERO-100 (Long) 34 skill classes, chained into sequences of 5
Total tasks ~130 tasks One shared environment with compositional task chains
デモンストレーション scale Around 6500 human teleoperation demos (50 per task) ~24 hours of teleoperation across 4 environments
Simulator Robosuite / MuJoCo PyBullet (custom tabletop)
Embodiment Franka Emika Panda (7-DoF) Franka Emika Panda (7-DoF) with parallel gripper
Environment splits Per-suite train/test with held-out configurations Environments A, B, C, D for zero-shot transfer
Language labels Yes, per task Yes, crowdsourced natural language instructions
Evaluation metric Success rate per suite + forward / backward transfer Avg. sequence length successfully completed (out of 5)
License MIT MIT
Paper arXiv:2306.03310 arXiv:2112.03227

LIBEROが実際にテストする

LIBERO ("Lifelong Learning Benchmark for robot manipulation") は,模倣学習文献のギャップに反応として UT・オースティンと協力者によって構築されました. 基準値は4つのタスクセットに分かれ,それぞれ約10つのタスクと50つのテレオペレーションデモをタスクごとに行う.

4つのスイートは,LIBERO-Spatial** (同じ物体,異なる空間関係),LIBERO-Object** (同じレイアウトで異なる物体インスタンスを) LIBERO-Goal (共有物体との異なる目標指示) と **LIBERO-100 (Long) **です. 最初の3台は,分散シフトの単一軸を隔離するように設計されています. LIBERO-100はすべてを混ぜます.

LIBEROを現代的なVLA評価に魅了しているのは,分別的なタスク構造がランキングボードのスタイルのレポートに清潔に映射されていること. [OpenVLA,Octo,pi0,および類似の基盤ポリシー]T5) を評価すると,論文は通常,suite1個に4個数字を報告します. これは,単一の長視点を消費するよりもはるかに簡単で,2024年半ばから LIBEROを標準的なVLA評価セットにしました.

実際のCALVIN検査は

2022年にフリーブルグ大学がリリースしたCALVIN ("Composing Actions from Language and Vision") は,別の質問に答えています. 政策のチェーンスキルは自然言語によって指定された長いシーケンスに個別に組み込まれているのでしょうか. 作業ファイルは数百個ではなく,キャルヴィンはドラフト,スライドドア,色彩のブロック,LED,ボタンを搭載した単一の共有テーブルタスク環境を配信しています.

データのセットは,視覚的に異なる四つの環境 (A,B,C,D) に分布した約24時間間の人間の遠隔操作である.標準評価プロトコルは環境の1つ (またはサブセット) に電車をかけて,別の環境で評価し,自然的なゼロショットまたは少ショット一般化メトリックを生成します. カルビン報告のヘッドライン番号は,5つのうちの順調な指示の平均数であり,2026年にまだ飽和していない急激な難度梯度を生み出します

カーヴィンは,単一のスキル精度に対して,長期間のパフォーマンスがどれだけ崩れ落ちるかを見ることができる数少ない基準の一つです. 個々のスキルに95%の精度が与えられている政策は,しばしば2つの鎖の指示の下に落ちます. これは記憶力,計画,または目標条件の目標をテストする際に望まれる信号です.

取引:いつどちらを選ぶか

**Liberoを選択してください. もし,あなたがRobosuiteに接続された高速で低摩擦基準を欲しがり,生涯学習や継続的な学習を気にかけ,あなたの数字がOpenVLA/Octo/pi0ランキングボードに直接比較されるようにしたいか,またはアブラレーションのためにクリーンなスイート別分が必要なら. 軽量で,単一のスーツは,適切なGPUで1時間で完成します.

CALVIN を選択する 長期的構成推論が必要なら,スキルレベルとチェーンレベルでのパフォーマンスとの差が気になるか,共有環境で目標イメージや言語のみの条件付けをテストしたいなら.

2026年にVLA論文を公開する場合は,両方を選択してください. LIBERO番号を報告することはほぼ必須になっています.そして,CALVIN序列は,リベロがしないという長視線信号をレビュー者に与えます.

コンピュータとハードウェア

両ベンチマークは単一の消費GPUで動作する.Mujokoにより,LIBEROは物理段階のためにCPUに結合しており,多くの並行環境を展開する際には8+コアCPUから恩恵を受けています.CALVINはPyBulletで動作します.これは並行型が少ないが画像空間探査でデバッグが容易になります.どちらもベンチマークにはデータセンターGPUの必要がありません.

訓練では,形は違います. LIBEROやCALVINのデモの上でフルスケール VLAトレーニングは,シムが重くてではなく,視覚言語のバックボーンが重くて4-8GPUが必要なのです.自分の訓練されたポリシーを持ち,評価のみを行う場合は,単一のワークステーションが機能します.ポリシーアーキテクチャを繰り返したい場合は,複数のGPUホストを計画してください. 軌道ストレージと評価オーケストレーションも ダウンロードできます

データ収集作業流

この2つのデータセットはVRではなくキーボード/ゲームパッドのテレオペレーションで収集された.これは歴史的に重要なことであり,デモを低騒音で重複性が高いため,またVRで収集されたデータセットであるBridgeDataまたは RoboMimicのような動き分布を狭くする. LIBEROやCALVINで訓練し,実際のハードウェアに展開するチームは,より多様なテレオップデータで拡張する必要があります.

ライセンス・リアリティチェック

このプロジェクトにはMITのライセンスがあり,学術データが得られるほど許容性があります.データセットの両方で商業政策を訓練し,衍生品チェックポイントを再配布し,製品に組み込むことができます. RobosuiteとCALVINにバンドルされた assets (網格ファイル,テクスチャーマップ) は独自のライセンスを持っています.資産を抽出して再ホストすると,上流属性を再確認します. 実験では,チームは軌跡データを MITとシミュレーターを Robosuiteや PyBulletの上流ライセンスとして扱います.

2026年にエコシステムと道具

LIBEROは,より大きな包装エコシステムを持っています.LeRobotはサポートしており,HuggingFaceは複数のプリプロセッサリリースをしており,ほとんどのVLA reposは LIBERO eval スクリプトを送信しています.CALVINはより深い層に配置されています.

2026年の論文で報告された結果

LIBEROでは,2025年のVLA政策 (OpenVLA,pi0,Octo変数) が強く,通常は空間,オブジェクト,ゴールで7090%の成功範囲に,トレーニングレシピに応じて LIBERO-100では3060%の成功範囲にたどり着く. 広報は興味深い.最初の3つのスイートでうまく行った政策は LIBERO-100の崖から落ちてしまう.これは単一の平均数で隠すような一般化差が明らかになる.新しい論文を読むとき,平均よりも毎スイート分解をチェックしてください.平均を報告する論文は,正直,何かを隠しています.

CALVINでは,見るべきメトリックは Avg. Seq. Len. です. 強力な2025モデルは,より簡単なAからAの評価で約3.5-4.0に達し,ゼロショットDの評価では2.0-3.0に低下します.ゼロショットDの4.0以上のものは2026年初旬から最先端とみなされます. ステップ回帰が劇的に複合されるため,それはまさにCALVINを有用な基準にする特性が.

レロボットスタックとの統合

両データセットはレロボットを通じて鏡形で利用できます.レロボットは軌道のスケーマを正常化し,PyTorch T1インターフェースを露出し,断片化されたビデオ解読処理を行います.あなたが散布ポリシーまたはトランスフォーマーポリシーをゼロから訓練している場合は,レロボット経路はカスタムロードを書きずにリベロとカルビンの両方を消費する最も速い方法です. 評価のために,まだオリジナルの LIBERO または CALVIN eval ハネスを実行する必要があります ランキングボードが依存する公式タスク設定と成功チェックを搭載しています.

判決

単一の勝者はいません.もし1つしか実行できなければ,LIBERO を実行すれば,それは2026年の論文で安く,速く,標準的なものになり,最も幅広い予備訓練された政策に接続できます.あなたの研究質問が特に長視野言語チェーンについてである場合,CALVINはまだユニークで,まだ飽和していない.今日最も深刻なVLA論文は両方報告しています.そしておそらくあなたにもそうするべきです. 計算予算が狭いチームは LIBERO を優先すべきであり,計画,メモリ,階層政策を研究するチームは CALVIN を優先すべきである. そして,輸送について真剣に取り組むチームは,ベンチマークの後,実世界のデータ収集に移動すべきである.

関連資源

  • [LIBEROデータセットの詳細]
  • [CALVIN基準ページ]
  • [X-Embodyment vs DROIDの比較]
  • [ブリッジデータとロボミミック比較]
  • [2026年のベストロボット学習データセット]
  • [VLAと政策モデルカタログ]
  • [我々の研究報告]