Datasetsに戻る

LIBERO: ロボット学習の benchmark

LIBERO を 探検する: 130 件の 課題,65K の デモ 4 つの生涯学習 セット.ダウンロード,OpenVLA/ディフュージョン ポリシー の 訓練,ベンチマーク 転送. 10 分で開始.

ローボットの操作政策における常識的な生涯学習模倣評価対象となった 130タスク, 65Kデモ基準のリベロのキュレーションガイド

TL;DR

Metric Value
Task count 130 tasks across 4 suites (Spatial, Object, Goal, LIBERO-100)
Robots Franka Emika Panda (simulated via RoboSuite)
Modalities RGB (2 cameras), proprioception, gripper, language
License MIT
Size ~65,000 demonstrations, ~40 GB HDF5
Simulator RoboSuite (MuJoCo)

LIBEROとは何か?

LIBERO (Lifelong Robot Learning Benchmark) は UT オースティンロボット認識と学習ラボが導入した研究基準で,操作政策が継続的な課題の流れにわたって知識をどのように転送するか研究しています. 固定されたデモを記憶する単一のポリシーを要求する代わりに, LIBEROは,130のテーブルタスク操作を生涯学習の4つのスーツに組織し,それぞれ異なる転送軸を隔離します. LIBERO-Spatialはオブジェクトの配置を変化させ, LIBERO-Objectはオブジェクトのアイデンティティを変化させ, LIBERO-Goalはタスクの目標を変化させ, LIBERO-100 (LibERO-90プレートレーニングと LIBERO-10評価に分割) は日常スキルの一番の長距離構成をテストします.

フランカ・エミカ・パンダのロボットシミュレーターで収集された50人の人間の遠隔操作によるデモを搭載した各任務船は,合計約65,000の軌道を生成する.観測にはRGBカメラの2つのストリーム (エージェント視野と手中),プロピオセプティブ関節状態,グリッパー状態,自然言語指示文字列が含まれています. 基礎真実オブジェクトとシーンメタデータは暴露され 研究者は特権情報ベースライン,手続き通用化,または simからリアルへの分布シフトを研究することができます.

基準値は,RoboSuiteとドロップイン対応で,Gymのスタイルの評価ハネスを搭載しているため,LIBEROは視覚言語行動モデルにおける事実上の生涯学習評価対象となった.OpenVLA,Octo,Difusion Policy,ACT,BC-ZはすべてLIBERO番号を公開し,新しいポリシーをシェアランキングボードに掲載する最も速い方法となっている.

ダウンロードと読み込み方法

標準分布は HDF5 で,OpenVLA チームによって使用されている修正された RLDS フォークもあります.

# Clone the benchmark code
git clone https://github.com/Lifelong-Robot-Learning/LIBERO.git
cd LIBERO && pip install -e .

# Download the HDF5 datasets (~40 GB)
python benchmark_scripts/download_libero_datasets.py --datasets libero_spatial libero_object libero_goal libero_100

# Or pull the RLDS fork used by OpenVLA / Octo
pip install datasets
python -c "from datasets import load_dataset; d = load_dataset('openvla/modified_libero_rlds', split='train'); print(d[0].keys())"

調整のために,RLDS バリアントは,OpenVLAとOctoトレーニングスクリプトに直接接続されます.評価のために,送信された T1エントリーポイントを使用します. シーンはロードされ,言語指示を再現され,元のタスク特別の報酬で成功スコアが付けられます.

共通用例&ペアリング

  • **VLAの調整を図る. ** OpenVLAとOctoはどちらも LIBEROの調整を図るチェックポイントを公開しています.
  • 拡散政策とACT基線* 50のデモ/タスク設定は,拡散とトランスフォーマー政策によく匹敵し,ランキングボードは公表された数字と比較して比較を容易にする.
  • 継続的な学習研究. この4つのスイートは,大きなサンプルサイズで忘れ,前向き転送,後向き転送を測定できる,公開規模でのロボット操作基準です.
  • 手順拡張. シーンはMuJoCo XMLで定義されているため,研究者はしばしばLIBEROとMimicGenまたはドメインランダム化を組み合わせ,データスケーリング法を研究します.

ランキングとランキング

公的なランキングボードは,各スイート (LIBERO-Spatial, LIBERO-Object, LIBERO-Goal, LIBERO-10) で平均的な評価展開500件以上を追跡しています.現在の最新技術は,最初の3スイートで95%+と LIBERO-10では50-60%の範囲にあります.