ロボットデータ収集を1万以上のデモに拡大する方法
機械の遠隔操作データ収集を 数百から数千回のデモまで 拡大するための技術課題と解決策
[←研究]
単発発機パイロットから多発実験室の艦隊まで 規模で政策訓練データを収集するために必要なインフラストラクチャ,オペレーター管理,品質システム
規模 を 拡大 する こと が 難しい の は なぜ です か
実験は200件を集める工程プロジェクトです. 10,000件を集めるのは作業の問題です. 瓶頸は完全に変化します. 小さくハードウェアとタスク仕様をデバッグしています. 大規模でオペレーター吞吐量,データパイプラインの信頼性,クロスラボ一貫性を管理しています.
ロボット学界は,DROID (76,000軌跡,22ロボット,13ラボ) と Open X-Embodiment (1M+エピソード,22ロボットタイプ) のようなデータセットを構築してこのことを学んだ.これらのプロジェクトそれぞれに,設計に数ヶ月かかる目的で構築されたインフラが必要でした.この記事は,動作するパターンを記録します.
運用者通路ボトルネック
データの収集速度における最大の制限は,オペレーター通量です. 適度な複雑性のある作業を実行する熟練したオペレーターは (私たちの [難度スケール] L2
- 50回のデモ/オペレータ/日: 40日間同時に動作するオペレータ5人
- 30回のデモ/オペレータ/日 (より難しい任務): 40日間9人のオペレータ
- さらにQA拒否に対する 20
30%バッファ: 1 2の追加オペレーター
品質を高にして,5
分布式コレクションアーキテクチャ
単一の研究室規模 (週に200件) を超えて,複数のステーションや研究室に分散した収集が必要です.DROIDデータセットは同時に13つの学術研究室で実行されました.
- 共有データ湖: すべてのラボは標準化された HDF5 スキーマを使用して,共通の S3 バケットにエピソードファイルを書き込む.エピソードメタデータ (オペレーター ID,ロボットシリアル,タイムスタンプ,タスク ID,成功ラベル) は,エピソード完了時に原子的に書き込まれます.ポストホック正常化を必要とする各ラボスケーマを避ける.
- ハードウェア標準化: すべてのサイトで同じカメラモデル,マウントポジション,ロボット構成を使用します.カメラ位置の微小差 (5
10cm) もサイト間政策訓練を劣化します.校准プロトコル文書を公開し,遠隔検証セッションを実行します. - タスク指示プロトコル: 画像,オブジェクト配置テンプレート (レーザーカットアクリルトレイがうまく動作する) と正しいと不正な実行のビデオ例を含む標準化されたタスクカード.これなしでは,異なるサイトでのオペレーターはタスクの微妙に異なる解釈を開発します.
- リアルタイムモニタリングダッシュボード: 共有ダッシュボードのサイトごとにデモ/時間,成功率,アクティブオペレーターを追跡します. これは,大きな予算を消費する前に,サイトレベルの問題を (ハードウェア故障,オペレーター混乱) 明らかにします.
事業者の質量管理を規模で
品質管理とは, 作業方針を訓練するデータセットと, 作業方針を訓練しないデータセットの違いです. 規模では,各エピソードを手動でレビューすることはできません.
- ** ゴールドスタンダードデモ:** 最高のオペレーターからタスクごとに20
50の"ゴールド"デモを収集します.これらのことを品質基準として使用します.新しいオペレーターデモとゴールドスタンダードの間に自動的に類似点スコア (共同軌跡のDTW,成功率関連) を計算します. - Inter-rater信頼性: 主観的な成功ラベルについては,二つのレビュー者が10%のエピソードを独立したラベルに付けること.コーエンのカッパを測定する.目標 κ > 0.8.カッパが0.7未満であれば,あなたの成功基準は曖昧で,精錬が必要.
- オペレータースコアカード: 事業者ごとに成功率,拒絶率,および通量を週に1回追跡する.持続的な拒絶率 >35%の事業者は再訓練または再割り当てが必要である.
- 奨励金構造: 品質額 (量額ではなく) のボーナスにより,オペレーターが急ぐことができません. 承認されたデモ額 (品質基準を超えた) に 0.10$~0.25$のボーナスで,データ品質に対する時間額のみの報酬が上回ります.
データパイプラインインフラストラクチャ
自動化パイプラインが必要です 映像キャプチャから訓練準備が整ったテンソールまで
- **エピソード形式:**標準化されたスケーマ (観測グループ:カメラ画像,プロピオセプション;アクショングループ:共同速度またはエンドエフェクターデルタ;メタデータグループ:タスク,オペレータ,タイムスタンプ) のHDF5
- 自動認証: 摂取時に実行する: (1) スケーマの検証, (2) 期間チェック (ほとんどの作業では <2s または >120s のエピソードを拒絶する), (3) 共同制限違反チェック, (4) カメラのドロップアウト検出 (ブラックフレーム)
- バージョン化: データセットバージョンをタグする際には DVC (Data Version Control) やカスタムマニフェストシステムを使用します.トレーニングランスは,データセットバージョンの変更のないバージョンを参照する必要があります.
- 前処理: 画像のサイズ変更,正常化,拡張は,訓練時に原始 HDF5から,保存されたデータに焼かれずに適用されるべきである.これは再収集なしに異なる拡張パラメータで再処理を可能にする.
質量 フィルタリング
操作員管理が良ければ,トレーニングセットに入れないエピソードの20~40%も手に入ります. 手動レビューは数千エピソードを超えてスケールしません.
- 成功分類器: 終盤から成功/失敗を予測するために,手動にラベル付けされた500
1,000エピソードのサブセットで軽量バイナリー分類器 (ResNet-18または類似) を訓練する.残りのすべてのエピソードに適用する.ポジティブなクラスで90%+精度を目標する. - 軌道の異常検出: 節目ごとに統計を計算する (最大関節速度,軌道の長さ,行動エントロピー). 孤立森林または単純な限界規則を使用して異常値を標示します.異常値は不均衡なエラーエピソードです.
- 多様性サンプル: フィルタリング後,あなたのトレーニングセットがすべてのタスクバリエーション,オブジェクトポジション,オペレータースタイルに覆われていることを確認します.エピソード埋め込みに k-meansをクラスターして,不足している領域を特定し,より多くのデータを収集します.
産業からの実数
| Dataset | Trajectories | Labs / Sites | Robot Types | Collection Period |
|---|---|---|---|---|
| DROID (Stanford) | 76,000 | 13 labs | 1 (Franka) | ~8 months |
| Open X-Embodiment | 1,000,000+ | 22 institutions | 22 types | Aggregated 2016–2023 |
| ALOHA-2 (Stanford) | 1,500 | 1 lab | 1 (ALOHA-2) | 3 months |
| BridgeData V2 | 60,000 | 4 lab configs | 1 (WidowX) | ~12 months |
| RoboSet (UT Austin) | 20,000 | 1 lab | 1 (Franka) | 4 months |
DROIDデータセットは分散データ収集の黄金基準である.彼らの [技術報告] (
RCSVの [データ収集プラットフォーム]
データ収集プログラムをスケールする
RCSVは 50人以上の訓練を受けたオペレーター,自動化QAパイプライン,管理されたインフラストラクチャを備えた分散データ収集艦隊を運営しています 4~8週間で10K+のデモを配信します







