Researchに戻る

ロボットデータ収集を1万以上のデモに拡大する方法

機械の遠隔操作データ収集を 数百から数千回のデモまで 拡大するための技術課題と解決策

[←研究]

単発発機パイロットから多発実験室の艦隊まで 規模で政策訓練データを収集するために必要なインフラストラクチャ,オペレーター管理,品質システム

規模 を 拡大 する こと が 難しい の は なぜ です か

実験は200件を集める工程プロジェクトです. 10,000件を集めるのは作業の問題です. 瓶頸は完全に変化します. 小さくハードウェアとタスク仕様をデバッグしています. 大規模でオペレーター吞吐量,データパイプラインの信頼性,クロスラボ一貫性を管理しています.

ロボット学界は,DROID (76,000軌跡,22ロボット,13ラボ) と Open X-Embodiment (1M+エピソード,22ロボットタイプ) のようなデータセットを構築してこのことを学んだ.これらのプロジェクトそれぞれに,設計に数ヶ月かかる目的で構築されたインフラが必要でした.この記事は,動作するパターンを記録します.

運用者通路ボトルネック

データの収集速度における最大の制限は,オペレーター通量です. 適度な複雑性のある作業を実行する熟練したオペレーターは (私たちの [難度スケール] L2L3 T1)) 毎日3080のデモを完了します. 8週間 (40 労働日) で10,000のデモに達するには,必要なのは:

  • 50回のデモ/オペレータ/日: 40日間同時に動作するオペレータ5人
  • 30回のデモ/オペレータ/日 (より難しい任務): 40日間9人のオペレータ
  • さらにQA拒否に対する 2030%バッファ: 12の追加オペレーター

品質を高にして,512の同時事業者を調達,訓練,維持することが核心課題である.事業者は機能できない.事業者間の品質差は大きい (同じ作業で6095%の成功率は,単一のチーム内で一般的です).この差異を管理するには,アドホックレビューだけでなく,体系的なQAが必要です.

分布式コレクションアーキテクチャ

単一の研究室規模 (週に200件) を超えて,複数のステーションや研究室に分散した収集が必要です.DROIDデータセットは同時に13つの学術研究室で実行されました.

  • 共有データ湖: すべてのラボは標準化された HDF5 スキーマを使用して,共通の S3 バケットにエピソードファイルを書き込む.エピソードメタデータ (オペレーター ID,ロボットシリアル,タイムスタンプ,タスク ID,成功ラベル) は,エピソード完了時に原子的に書き込まれます.ポストホック正常化を必要とする各ラボスケーマを避ける.
  • ハードウェア標準化: すべてのサイトで同じカメラモデル,マウントポジション,ロボット構成を使用します.カメラ位置の微小差 (510cm) もサイト間政策訓練を劣化します.校准プロトコル文書を公開し,遠隔検証セッションを実行します.
  • タスク指示プロトコル: 画像,オブジェクト配置テンプレート (レーザーカットアクリルトレイがうまく動作する) と正しいと不正な実行のビデオ例を含む標準化されたタスクカード.これなしでは,異なるサイトでのオペレーターはタスクの微妙に異なる解釈を開発します.
  • リアルタイムモニタリングダッシュボード: 共有ダッシュボードのサイトごとにデモ/時間,成功率,アクティブオペレーターを追跡します. これは,大きな予算を消費する前に,サイトレベルの問題を (ハードウェア故障,オペレーター混乱) 明らかにします.

事業者の質量管理を規模で

品質管理とは, 作業方針を訓練するデータセットと, 作業方針を訓練しないデータセットの違いです. 規模では,各エピソードを手動でレビューすることはできません.

  • ** ゴールドスタンダードデモ:** 最高のオペレーターからタスクごとに2050の"ゴールド"デモを収集します.これらのことを品質基準として使用します.新しいオペレーターデモとゴールドスタンダードの間に自動的に類似点スコア (共同軌跡のDTW,成功率関連) を計算します.
  • Inter-rater信頼性: 主観的な成功ラベルについては,二つのレビュー者が10%のエピソードを独立したラベルに付けること.コーエンのカッパを測定する.目標 κ > 0.8.カッパが0.7未満であれば,あなたの成功基準は曖昧で,精錬が必要.
  • オペレータースコアカード: 事業者ごとに成功率,拒絶率,および通量を週に1回追跡する.持続的な拒絶率 >35%の事業者は再訓練または再割り当てが必要である.
  • 奨励金構造: 品質額 (量額ではなく) のボーナスにより,オペレーターが急ぐことができません. 承認されたデモ額 (品質基準を超えた) に 0.10$~0.25$のボーナスで,データ品質に対する時間額のみの報酬が上回ります.

データパイプラインインフラストラクチャ

自動化パイプラインが必要です 映像キャプチャから訓練準備が整ったテンソールまで

  • **エピソード形式:**標準化されたスケーマ (観測グループ:カメラ画像,プロピオセプション;アクショングループ:共同速度またはエンドエフェクターデルタ;メタデータグループ:タスク,オペレータ,タイムスタンプ) のHDF5
  • 自動認証: 摂取時に実行する: (1) スケーマの検証, (2) 期間チェック (ほとんどの作業では <2s または >120s のエピソードを拒絶する), (3) 共同制限違反チェック, (4) カメラのドロップアウト検出 (ブラックフレーム)
  • バージョン化: データセットバージョンをタグする際には DVC (Data Version Control) やカスタムマニフェストシステムを使用します.トレーニングランスは,データセットバージョンの変更のないバージョンを参照する必要があります.
  • 前処理: 画像のサイズ変更,正常化,拡張は,訓練時に原始 HDF5から,保存されたデータに焼かれずに適用されるべきである.これは再収集なしに異なる拡張パラメータで再処理を可能にする.

質量 フィルタリング

操作員管理が良ければ,トレーニングセットに入れないエピソードの20~40%も手に入ります. 手動レビューは数千エピソードを超えてスケールしません.

  • 成功分類器: 終盤から成功/失敗を予測するために,手動にラベル付けされた5001,000エピソードのサブセットで軽量バイナリー分類器 (ResNet-18または類似) を訓練する.残りのすべてのエピソードに適用する.ポジティブなクラスで90%+精度を目標する.
  • 軌道の異常検出: 節目ごとに統計を計算する (最大関節速度,軌道の長さ,行動エントロピー). 孤立森林または単純な限界規則を使用して異常値を標示します.異常値は不均衡なエラーエピソードです.
  • 多様性サンプル: フィルタリング後,あなたのトレーニングセットがすべてのタスクバリエーション,オブジェクトポジション,オペレータースタイルに覆われていることを確認します.エピソード埋め込みに k-meansをクラスターして,不足している領域を特定し,より多くのデータを収集します.

産業からの実数

Dataset Trajectories Labs / Sites Robot Types Collection Period
DROID (Stanford) 76,000 13 labs 1 (Franka) ~8 months
Open X-Embodiment 1,000,000+ 22 institutions 22 types Aggregated 2016–2023
ALOHA-2 (Stanford) 1,500 1 lab 1 (ALOHA-2) 3 months
BridgeData V2 60,000 4 lab configs 1 (WidowX) ~12 months
RoboSet (UT Austin) 20,000 1 lab 1 (Franka) 4 months

DROIDデータセットは分散データ収集の黄金基準である.彼らの [技術報告] (T2) は,校正プロトコル,データフォーマット,および品質フィルタリングパイプラインを詳細に文書化している.マルチラボプログラムを構築するチームには,読み取りが必要です.

RCSVの [データ収集プラットフォーム]T3) は,本記事に記述されたアーキテクチャを実装します エピソードストリーミング,自動QA,オペレーターダッシュボード,およびS3サポートされたバージョンのストレージ が管理サービスとして利用可能です.

データ収集プログラムをスケールする

RCSVは 50人以上の訓練を受けたオペレーター,自動化QAパイプライン,管理されたインフラストラクチャを備えた分散データ収集艦隊を運営しています 4~8週間で10K+のデモを配信します

データサービスを探求 →