2026年 ロボット学習データセット:完全なガイド
2026年の10のベストロボット学習データセットにランクインしました. オープンX-Embodiment,DROID,BridgeData,LibERO,CALVIN,ALOHAなど,スケール,ライセンス,および使用事例.
2026年にロボット学習の研究は,有用な作業の90%を遂行する驚くほど小さなデータセットに収束した.このガイドでは,模倣学習,VLAトレーニング,ベンチマークレポートに関する10のベストオープンデータセットを 率直に述べ,それぞれが良いこと,何が悪いこと,どのライセンスを期待できるかを表しています. このページをスタートマップとして使用します. 各データセットはダウンロード指示を付いた深層ダイビングページにリンクします.
迅速な選択
- 訓練コルプ: オープンX体体
- 現実の世界のフィニチューン: DROID
- 低コスト実世界: BridgeData V2
- VLA eval: LIBERO
- 長視線言語: カルビン
- 制御された IL研究: RoboMimic
- 双手技巧: ALOHA
ランキングの仕方
規模 (原軌跡数と時間数) 品質 (センサー一貫性,カメラ装置の安定性,アクションスペースの清潔性),ライセンス (商業的フレンドリー性),生態系サポート (レロボット,ハグジングフェイスでの利用可能性,公式の評価スクリプト,予備訓練されたチェックポイント) と研究関連性 (ロボット学習論文の引用数 2025-2026). ランキングは 生産や出版のパイプラインに 実際有用なデータセットに偏っています
1.開いたX体体
なぜ1位位になるのか: OXEは,現存する最大規模のオープン操作コープス (1M+エピソード22実施形態) で,RT-1-X,RT-2-X,OpenVLA,Octo,piの予備訓練基材である.一般主義的な方針を望むなら,OXEを初心として求める.ライセンスは各構成要素;ほとんどのものはCC-BY-4.0またはApache-2.0です. [Open X-Embodimentページ]
2. DROID
なぜ2位位になるのか: DROIDは最もきれいな実世界のデータセットです. 76Kの軌跡,564シーン,シングルフランカパンダ実施形態,一貫したZED 2カメラリグ,MIT+CC-BY-4.0.
3.ブリッジデータ V2
なぜ3位位になるのか: BridgeData V2は最もアクセス可能な実世界のデータセットです
4 図書
なぜ4位になるのか: LIBEROは事実上のVLA評価スーツになりました.4つのタスクスーツ,約130のタスク,6500のデモ,Robosuiteシミュレーション.2026年にポリシーアーキテクチャ論文を公開している場合は, LIBERO番号を要求されます. MITライセンス.私たちの LIBEROデータセットページ と LIBERO vs CALVIN 比較を参照してください.
5 カーリン
**なぜ5位位になるのか:**CALVINは,CALVINの標準標準標準で,Chained long-horizon language instruction (rolloutごとに5まで) をクリーンなA/B/C/D環境の分割でテストする.24時間間のテレオップデータ.2026年にはまだ飽和していない.これは,鎖作業がどれほど難しいかについて何かを教えてくれる. MITライセンス. [CALVINの基準ページ]
6 機械化
なぜ6位位になるのか: RoboMimicのPH/MH/MG示範品質の分割は,模倣学習の強度の研究の黄金基準であり続けている. 五つのRobosuiteタスクがますます困難である. 部署データセットではなく,不可避な診断です. MITライセンス. [RoboMimicデータセットページ](
7 〜 ALOHA
なぜ7位位: ALOHAは低コストの双手通信を率いており,細粒度の巧妙な操作研究のためのデフォルトプラットフォームであり続けている.公式のALOHAデータセットとモバイルALOHA拡張子は双手VLA作業を推進し続けています.Apache / MIT. ALOHAデータセットページ および私たちの [ALOHAガイド](
8 ローボネット
なぜ8位位になるのか: 7つのロボットプラットフォームで15Mのビデオフレームがロボットネットワークを原作クロスインボディメントデータセットにしました.ほとんどのトレーニング目的でOXEによって置き換えられていますが,ビデオのみの学習と転送研究に価値があります. [ロボネットページ](
9 模倣遺伝子
なぜ9位位になるのか: ミミックジェンはデータ生成システムよりもデータセットが少ない.それは約200人の種から50K以上のデモを合成する. 組み合わせたシミュレーションタスクスーツは模倣学習研究に有用であり,ミミックジェンのパイプライン自体は現実世界収集を拡張するための標準となっています. Apache-2.0. [MimicGenページ](
10 〜 レロボットハブ
**なぜ10位になるのか:**LeRobotは単一のデータセットではなく分布層です. DROID, ALOHA, BridgeData, Open X コンポーネント, SO-100などで統一された PyTorch インターフェースです.実用的な2026 ワークフローのために,LeRobot は上記のデータセットをすべて消費する最も簡単な方法です.Apache-2.0.
概要表
| Rank | Dataset | Domain | Scale | Best for | License |
|---|---|---|---|---|---|
| 1 | Open X-Embodiment | Real (mixed) | 1M+ episodes | Pretraining | Per-component |
| 2 | DROID | Real (Franka) | ~76K trajs | Real fine-tune | MIT / CC-BY |
| 3 | BridgeData V2 | Real (WidowX) | ~60K trajs | Low-cost real | CC-BY-4.0 |
| 4 | LIBERO | Sim (Robosuite) | ~130 tasks | VLA eval | MIT |
| 5 | CALVIN | Sim (PyBullet) | 24 hrs teleop | Long-horizon | MIT |
| 6 | RoboMimic | Sim | 5 tasks, PH/MH/MG | IL study | MIT |
| 7 | ALOHA | Real (bimanual) | Task-specific | Dexterous | MIT / Apache |
| 8 | RoboNet | Real (mixed) | 15M frames | Video / transfer | MIT |
| 9 | MimicGen | Sim | 50K+ synth | Data augmentation | Apache-2.0 |
| 10 | LeRobot Hub | Distribution | Hundreds of datasets | Tooling | Apache-2.0 |
現代の訓練レシピ
2026年に,デプロイできる操作ポリシーを構築するためのモダルのレシピは3段階である.第一段階:プレトレーン (またはプレトレーンされたチェックポイントからスタート) オープンX-エンボディメント.第二段階:DROIDまたはBridgeDataで真世界のアクションディストリビューションをアンカーする中途半端のトレーニング.第三段階:目標ハードウェアで収集されたタスク特定のテレオペレーションデータに微調整. 各段階では一般化誤差を減らすこと,政策をさらに専門化すること.
基準値はこのレシピに _diagnostics_として適合する. LIBEROとCALVINは,ステージ1+ステージ2のポリシーが3段階の収集金を使う前に一般化するか,または一般化するか教えてくれます. RoboMimic PH/MH/MGは,あなたのポリシーが異性性を示すのに堅固かどうか教えてくれます.これらの基準のうち,どれも生産代理人ではありません.
2024年から2026年の間に何が変わったか
3つのことがデータセットの景色を改造した. まず,Open X-EmbodimentはRT-XとOpenVLAチェックポイントが公開された後",興味深い実験"から"避けられない予備訓練"へと移行した. 2024年にOXEを使用しなかったチームはほぼ全員が2025年に使用を開始した. 2つ目は,データセットリリースから標準化になったDROIDです. ZED-2-on-Frankaリグは複数の研究ラボで新しい実世界のデータ収集の事実上のテンプレートになりました. 3つ目は,レロボットエコシステムは,データセット消費をカスタマイズされたエンジニアリングプロジェクトからPyTorchに友好的商品に変えました.
流失したデータセットは,古い単作業シミュレーション基準 (Meta-World, FrankaKitchen) であった.それらはまだ引用されていますが,私たちが関心のある論文では主要な評価目標として表示されません.ロボネットは,ビデオベースの方法にとってまだ重要ですが, training corpusとして同様に衰退しています. リアルワールドでは ALOHAは 安定した立場に立った. 双手データはまだ稀で価値あるものなのです.
データのセットは含まれていない (なぜ)
ARIO,RH20T,AutoRTデータ,モバイル ALOHA拡張子などについて検討した.どれも前向きなものの,2026年に一般使用の確信のある推奨となるため,新しいもの,狭いもの,または単一のラボのハードウェアに縛られている.また,言語表 (Google) とMeta-Worldも検討した.OXE + DROID時代に広く知られるが,限界使用が減少している. 答えを返してください 答えを返してください 答えを返してください 答えを返してください
補完データ収集方法
生産ロボット工学チームは,オープンデータセットが提供できないタスク特有の遠隔操作データを必要とします.ここではシリコンバレーのロボット工学センターが適合します.私たちの データサービス はサンフランシスコのラボからフランカ,ウィドオックス,ALOHA,OpenArmプラットフォームでカスタムデータ収集キャンペーンを実行します. 典型的なキャンペーンでは,RLDSまたはLeRobot対応形式で配信される 26週間で,タスクごとに5005000の高品質の軌道を生成します.
内部で収集機能を構築したい場合は, [店舗]
よく聞かれる質問
2026年にどのロボット学習データセットから始めればいいのか?
オープンX-Embodimentで訓練されたチェックポイント (OpenVLAまたは pi0) からスタートし,DROIDを細かく調整します. LIBEROとCALVIN番号を報告します.実世界のデータセットを1つしか使用できない場合は,DROIDは最もきれいなものです.
オープンX-エンボディメントは商業用用で無料ですか?
OXEは各コンポーネントのライセンスを保有するコンポーネントデータセットのレジストリです.ほとんどのコンポーネントは CC-BY-4.0またはApache-2.0ですが,一部は研究専用です.商業方針を送信する前にコンポーネントリストを監査してください.
LIBERO と CALVIN の違いは何ですか?
LIBEROは Robosuite で 4 つの別々のタスク・スーツを備えた生涯学習基準で,VLA 評価のデフォルトです.CALVIN は 4 つの環境と 5 つの指示チェーンを持つ長視基準です.
計算機はいくら必要?
OpenVLAスケールでフルOXEプレトレーニングは,約64 A100を2週間使用した.DROIDまたはBridgeDataのプレトレーニングチェックポイントを1〜2日間で1つの8xA100ノードで実行する. LIBEROまたはCALVIN評価は単一の消費GPUで実行する.
ロボットデータセットを自分で収集できますか?
公開データセットは訓練前体として最適です. 部署のために,目標ハードウェアのタスク特定データが必要です.
関連資源
- [LIBERO vs.CALVIN比較]
- [X-Embody vs DROID]
- ブリッジデータとロボミミック
- [すべてのデータセットのカタログ]
- [VLAと政策モデル]
- [ベンチマークハブ]
- [調査報告]
- [ロボット学部]
- [ロボットハードウェアショップ]







