ロボネット:オリジナルクロスロボットビデオコープス
ロボネットを探検する 7 つのロボットと 4 つのラボで 15M のビデオフレームをダウンロードし,ビデオ予測と視覚的予測モデルを訓練し, 1 週末でクロスロボット転送を基準にします.
ロボネットの実践者のガイド フォローした各大規模な多ロボットリリースに テンプレートを確立した 15,000万フレーム,7ロボット,4ラボデータセット
TL;DR
| Metric | Value |
|---|---|
| Frame count | ~15,000,000 RGB video frames |
| Robots | 7 (Sawyer, Baxter, WidowX, Kuka iiwa, Franka, Fetch, Widow200) |
| Modalities | RGB video (1-4 cameras), Cartesian delta action, proprioception, gripper |
| License | MIT |
| Institutions | 4 labs (Penn, Stanford, UC Berkeley, CMU) |
| Original paper | CoRL 2019 (Dasari et al.) |
ロボネットとは何か?
ロボネットは 特定の質問に答えようとした 最初の真剣な試みでした 複数のラボが 自動で収集した ロボットビデオを 共有すれば 単一のビデオ予測モデルが ロボットや環境を 汎用化できるのでしょうか? スデュープ・ダサリーとペン大学,スタンフォード大学,UCバークレー大学,CMUの同僚は7つの異なるロボットプラットフォームから1500万のビデオフレームを集めて統一されたHDF5スケーマでリリースしました 2019年にロボットデータセットが通常ラボプライベートでプロトコル特有のときに 驚くべき成果でした.
重要なことに,ロボネットは言語条件による操作データセットではなく, _video prediction_データセットです.ほとんどのエピソードは自動で収集されます (さまざまなオブジェクトの前でランダムまたはスクリプトによる探索),テレ操作された専門家示例ではありません. このデザイン選択により ロボネットは多年もの間 ストカスタシービデオモデル (SVG,SVP,SV2P),ビジュアル予測プランナー,世界モデルベースの制御の基準となり 分野が現在 クロスロボットアクション条件による予測について考える方法を形作りました
ロボネットは,オープンX-EmbodimentとDROIDが原体規模で次々と倒れましたが,最もきれいな,最小かつ教育的に最も有用なクロスロボットデータセットであり続けています.そのスケーマは,カーテジアンデルタアクション,ロボット体現タグ,64x64または128x128 RGB であり,単一のGPUでクロスロボットビデオ予測ベースラインを立てることは依然として最も簡単です.
ダウンロードと読み込み方法
標準分布は,RoboNetウィキの HDF5 ショードセットで,参照 GitHub レポで送られるTFRecord 鏡が付いています.
# Pull the reference code
git clone https://github.com/SudeepDasari/RoboNet.git
cd RoboNet && pip install -e .
# Download the HDF5 shards (see https://www.robonet.wiki/ for bucket URLs)
python robonet/datasets/download_robonet.py --output_dir ./data
# Load episodes with the built-in reader
from robonet.datasets.robonet_dataset import RoboNetDataset
ds = RoboNetDataset(
batch_size=32,
dataset_files=["./data/*.hdf5"],
hparams={"img_size": [64, 64], "load_random_cam": True},
)
for batch in ds:
print(batch["images"].shape, batch["actions"].shape, batch["states"].shape)
フレームが小さい (64x64または 128x128) とアクションベクトルは短く, RoboNetは単一の消費 GPU で有意義な実験を実行できる稀なロボットデータセットの一つです.
共通用例とモデルペアリング
- ビデオ予測ベースライン. SVG, SVP, FitVid,およびオリジナルのVisual Foresightスタックは全てロボット間の参照としてRoboNetを使用しています.
- 世界モデルベースの制御. 組み合わせたアクション/観測シーケンスにより,多体化設定におけるドリーマー式世界モデルのための自然な試用場となります.
- 体体エンコーダー研究** 各シークルはロボットIDでタグ付けされているため,ロボネットは新しい腕に転送する体体埋め込みを学ぶための純粋なターゲットです.
- 教学/コースワーク* フレームサイズが小さく,清潔なHDF5スキーマが RoboNetを卒業ロボット学習クラスにおけるデフォルトデータセットにします.
ランキングとランキング
閉ざされたランキングボードはありませんが,標準評価はPSNR/SSIM/LPIPSで10ステップの未来フレーム予測で,実行されたアクションシーケンスに基づいて,見たロボットと見えないロボットに別々に報告されています.参照番号については, Papers with Code RoboNet entry, 公式ウィキ,および Dasari et al. CoRL 2019 paper を参照してください.
テクニカルディープダイビング:カーテジアンデルタアクションと実施形態ID
ロボネットのアクション表現は2019年に異常に野心的なものでした. ロープの共同目標やモーターコマンド (各ロボットによって異なる) を記録する代わりに,著者はすべてのアクションを5次元カルテジアンデルタにマッピングしました. xyz翻訳と yaw 回転とバイナリーグリッパービット. 配備ロボットのほとんどは,コレクションセットアップでトップダウンのみを把握することをサポートしていたため,ピッチンアンドロールは固定されていました.この正常化は,単一のビデオ予測モデルが7つの異なる腕からのアクションに条件付けられるようにするものです.
各軌道は,ポリシーが無視できる整数実施形態 ID (一般的なクロスロボットモデルを学ぶ) または条件 (ロボット特有の動力性を利用) とタグ付けられています. この後者のアプローチは,後続文献における支配的なパターンの一つとなり,Octoで使用されるデータセットの埋め込みとOpenVLAにおけるアクション正常化スキームを直接インスピレーションさせた.
ビデオフレームは,特に,コモディティハードウェアでビデオ予測ベースラインが実行できるように,低解像度 (64x64または 128x128によって) で保存されます.より高い解像度映像が必要な場合は,Open X-EmbodimentとDROIDはフル解像度RGBの両方を搭載し,現代の視力重管道に優先されるべきです.
既知の制限
- 低分辨率* 64x64または 128x128フレームは,現代のピクセルベースのポリシーでは使用できない.ロボネットは,生産システムのための訓練対象ではなく,歴史的な基準です.
- 自動 (専門家ではない) データ. ほとんどの軌跡はランダムな探査であるため,ロボネットは模倣学習に適していない
- 上下アクションスペースのみ. 5DoFの正常化はピッチとロールを減らして,操作レパートリーを平面の把握に制限します.
- 言語の注釈はありません. 番組はロボットと環境のIDでタグ付けされていますが,自然言語はありません.
常識問題
ローボネットは2026年にまだ使用に値するのでしょうか?
**OXEは50~100倍大きい,専門家示範を含む,言語注釈を送信する. ロボネットは小さく,ビデオのみ,自律探索に基づいています.それらは互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い互い
私は,現代のアクションラベル付きデータセットとRoboNetを組み合わせることができるか? はい







