スケーリングロボットデータ収集チーム: 1Kから100Kのデモ
規模を拡大する遠隔操作チームから 運用のレッスン 操作者層,規模での品質管理,インフラストラクチャの選択,デモコスト曲線
[←ブログ]
品質が低下し 瓶頸がどこにあるか 費用の曲線が何と変わるか 試行錯誤の数百から数万台のロボットに 拡大するにつれて
質量 の 低下: 警告 の 3 種
機械データ収集を拡大するチームのほとんどは 1,000 回のデモを中心に同じ壁に衝突します 品質は徐々に低下しません 崖から落ちます 品質危機が完全に起こる前に,品質危機を予測する3つの具体的な信号があります: 事業者間の差異のピーク (同じ作業によって事業者間で非常に異なる軌道のスタイルが生成されます), 拒絶率は40%以上上昇します (自動化されたパイプラインは収集されたデータのほぼ半分を廃棄しています) そしてパイプラインのボトルネックが出現します (貯蔵,事前処理,またはレビュー段階は,数日の遅れが続く).
根源は一貫性がある.チームが最初のスケーリングプロセスなしに人数をスケーリングする.未定義プロトコルに第5または第10のオペレーターを追加すると,吞吐量よりも不一致性が増強される.修正は構造的で,タイヤリングから始まります.
事業者 採用: 探すべきこと
操作者の品質の唯一最高の予測は,機械の知識ではなく,細い運動制御の経験である.RCSVのトップパフォーマンスオペレーターは,外科技術,歯科衛生,時計製造,競争的なゲーム,音楽楽器性能の背景から来ている.
運行者の成功と関連する特定スクリーニング基準:
- 手動の技巧テスト: タイミングでペグ挿入板 (30ペグが60秒未満で下位40%を排除する) この15ドルのテストでは,履歴書スクリーニングよりも収集経路を予測します.
- 持続的な注意: 2時間間のセッションで一貫したパフォーマンスを維持する能力. ゲームやマイクロ手術の経験を持つ候補者は,通常ここで優れている.
- プロトコル遵守: 精密なリセット手順に従う意欲.即興するクリエイティブ・オペレータは,規模で責任がある.
- 空間推論: ロボットのエンドエフェクター座標枠に手動きをマッピングする能力.VRゲーム体験はこのスキルの強力な代理です.
ロボット学の博士号生は,繰り返し演示を行うよりもシステムを理解し,最適化したいため,しばしば中等な操作者を作ります.最も優れた操作者のプロフィールは,技術者ではなく,規律のある技術者です.
5 日 間の 運用 者 の 訓練 課程
RCSVは,複数のキャンペーンタイプを介して40以上のオペレーターをオンボードした後,このカリキュラムを開発しました.毎日は以前のものに基づいています.そして,オペレーターは前進する前にゲートテストを通過する必要があります.
日1: 安全とハードウェアの方向性 (4時間)
- 各ロボットステーションのE-ストップ位置と手順
- リーダーとフォロワー腕のピンチポイント識別
- ダウン・オフのシーケンスとハードウェア故障プロトコル
- カメラとセンサーケーブルルーティング 触らないべきもの
- ゲートテスト: 動作位置から5秒以内に緊急停止と完全停止を実行する
日2: テレオペレーションインターフェイスの熟知 (6時間)
- リーダー腕関節マッピング
どのリーダー関節がどのフォロワー関節を制御するかを理解する - 握手制御練習
開閉/閉じるタイミング,部分握手 - 作業場での最終効果を20の目標位置に移動する
- 作業場の境界意識
共同の限界,単一性の回避 - ゲートテスト: ゼロの作業スペース境界違反で3分未満で10の空間の作業を完了する
3日: 任務特別の訓練 (6時間)
- ウォッチのゴールドスタンダードデモ (QAリードセットからトップ10)
- 視覚的な例で書面的な成功基準文書をレビューする
- 監督の練習作業 リアルタイム反省による20回のデモ
- 黄金標準の並行で自社のデモを再現するレビュー
- ゲートテスト: 連続して10回のデモで,最初の合格率>80% (QAリードによる判断)
第4日:品質基準と自己評価 (4時間)
- 質量指標のレビュー:DTW距離,エピソード期間,滑らかなスコア
- 自己標識の実践:自身のエピソードをレビューし,成功/失敗を標識する
- 記者間の協定の校準:50話のセットのラベル共有,黄金のラベルと比較
- ゲートテスト: 合格/失敗ラベルで90%以上のQAリードと記者間協定
5日:生産作業流と校正 (4時間)
- 完全生産作業流:リセット手順,エピソード開始/停止,メタデータ入力,自認チェック
- 生産速度で20回のデモを完了し,デモ時間ごとに測定する
- 疲労管理:予定された休憩プロトコル (90分毎に15分)
- ゲートテスト: 作業レベルでの生産品質の20回の連続実証
ゲートテストに失敗したオペレーターは,その日のトレーニングを繰り返します.私たちの経験によると,約15%の候補者は3日目 (タスク実行) に,さらに5%が5日目 (持続的な通量) に洗濯します.カリキュラムを完了した80%は,最初の生産セッションから品質基準を満たすデータを生産します.
運用者レベルおよびタスクタイプによる経路基準
これらの基準値は,30以上のキャンペーンにおけるRCSV生産データに基づいています. "Throughput"は,自動化された品質フィルタリングと手動のスポットチェックを通過する時間あたり使用可能な純示例です.
| Task Type | Expert Operator | Trained Operator | New Operator (post-training) | Reset Time |
|---|---|---|---|---|
| Simple pick-place (single arm) | 10-12 demos/hr | 7-9 demos/hr | 4-6 demos/hr | 15-20s |
| Multi-object sorting | 8-10 demos/hr | 5-7 demos/hr | 3-5 demos/hr | 30-45s |
| Bimanual coordination | 6-8 demos/hr | 4-6 demos/hr | 2-4 demos/hr | 45-60s |
| 精度(再現性) insertion (±1mm) | 5-7 demos/hr | 3-5 demos/hr | 1-3 demos/hr | 30-45s |
| Deformable object manipulation | 4-6 demos/hr | 2-4 demos/hr | 1-2 demos/hr | 60-90s |
| Mobile manipulation | 3-5 demos/hr | 2-3 demos/hr | 1-2 demos/hr | 90-120s |
重要な洞察:専門家と新しいオペレーター間の差は単純な作業の2-3倍,複雑な作業の3倍である. だからこそ,レベルシステムが重要だ.
運用者レベルシステム
3階層のオペレーター構造は,課題の複雑性を把握し,重要であれば品質を犠牲にせずにコストを制御する.
- ジュニア・オペレーター (22ドル/時間): 低技能要求の簡単なピックアンドプレイスタスクに割り当てられた
単腕のリーチ,平面の転送,繰り返しゴミ箱のピックアップ.ターゲット通量: 時給12 18デモ.オンボード時間:金標準のリプレイの校正を含む4時間. - シニア・オペレータ (30ドル/時間): 複雑な組み立て,双手調整,制限された挿入作業を処理する.最初の通過の受け入れ率>85%に達すると予想される.週間の校准セッションに参加し,曖昧なプロトコルケースを標識することができます.
- QA Leads ($45/h): 作業プロトコルを設計し,ゴールドスタンダードデモセットを定義し,校正セッションを実行し,自動分類者しきい値を管理し,フラッグされたパッチの最終的なレビューを実行する. 8
10オペレーターに1つのQAリードは持続可能な比率です.
QA ワークフロー: 三門質パイプライン
規模では,各エピソードを手動でレビューすることは不可能です. 3ゲートパイプラインはコストが増加する質の問題を捉え,それ故に,安価な自動チェックは,余剰に高価な人間レビューが実行される前に明らかな問題をフィルタリングします.
ゲート1:自動ヘューリスティックチェック (コスト: ~$0.001/エピソード)
各エピソードが記録された直後に実行します. これらのチェックは決定的なもので,明らかに無効なエピソードを拒絶します.
- 期間制限: 作業タイプで3s未満または3x以上の中継のエピソード →拒否
- センサーの完全性: どのカメラストリームでも>2つのフレームが落ちたり,または共同状態ログリングギャップ>50ms →拒否される
- **作業場制限:**最終エフェクターが任意の時点で定義された作業場包みを残す →拒否する
- **グリッパー状態の精神状態:**グリッパーは,握手作業中に閉じることはなく,場所作業中に閉じる →拒否
- 速度のピーク: ゲート2の旗で設定された黄金標準の95パーセントを超えた関数速度は
ゲート1は通常,原生エピソードの515%を拒絶し,さらに1020%を詳細な検査のためにマークします.拒絶率は健康メトリックです.
ゲート2: MLベースの成功分類 (コスト: ~$0.01/エピソード)
軽量なCNN分類器 (腕カメラの最後の10フレームのResNet-18) はバイナリー成功/失敗を予測する.タスクごとに200以上の黄金標準ラベルを付けられたエピソードで訓練されている.RCSV生産では以下のパフォーマンスレベルで動作する:
- 真のポジティブ率 (成功を正しく識別する): 92~96%
- 誤差を正しく識別する) 真の負の割合: 75-85%
- "不確実" (信頼度0.3-0.7) と分類されたエピソード: 8-12% →ゲート3へ送られた
分類器は故意に"成功"ラベルに高度な精度のために調節されている.成功ラベルに失敗したエピソードを含めることは,誤った拒絶に良いエピソードを失うよりも悪い.拒絶されたエピソードと不確実なエピソードは人間のレビューに導かれる.
ゲート3:ヒューマン・エキスパートレビュー (コスト: 0.502.00$/エピソード)
QAリードはゲイツ1と2号にマークされたすべてのエピソード,加えて両ゲートを過ぎたエピソードのランダムな5%サンプル (校正のために) をレビューする.レビューは,同期化されたマルチカメラ再生を2倍の速度で視聴し,成功基準をチェックすることを含む. ランダムサンプルは連続的な監査として機能する
質量管理を拡大する
標準化デモンストレーションは,スケーラブルな品質の基礎です. それぞれのタスクに対して,理想的な条件下でQAリードによって記録された標準化デモンストレーションを正確に50回維持してください. これらの機能は3つの目的を果たします: (1) ベースラインをオンボードする
週間校准セッションは10人のオペレータ以上で交渉できない.各セッションは30~45分:オペレータは5つの標準化されたタスクインスタンスを完了し,ポーズ軌跡DTW距離を通じて金標準と比較され,アウトレーヤーが個別にコーチされます. 校正作業におけるオペレーター間の変動は,あなたの主要な指標です 週ごとにDTWの差が増加した場合,あなたのプロトコルは漂流しています.
自動化された成功分類器は,実践で失敗の約60%を捕捉します.典型的なアーキテクチャは,手首カメラストリームの最後の10フレームで軽量なCNN,バイナリー成功/失敗出力,タスクごとに200以上のラベル付きの例で訓練されています.偽陽性率は偽陰性よりも重要です.
50Kデモキャンペーンのためのチーム構造
50,000人のデモキャンペーンが深刻な作戦課題である.RCSVがこのような規模でのキャンペーンに使うチーム構造とタイムラインは以下の通りです:
| Role | Count | Responsibility | Shift Pattern |
|---|---|---|---|
| Campaign Manager | 1 | Schedule, budget, client comms, overall quality | Full-time |
| QA Lead | 2 | Protocol design, calibration sessions, Gate 3 review | Full-time, staggered shifts |
| Senior Operators | 4-6 | Complex tasks, bimanual, mentor junior operators | 6hr shifts, 2 shifts/day |
| Junior Operators | 8-12 | Simple pick-place, resets, structured variation execution | 6hr shifts, 2 shifts/day |
| Data Engineer | 1 | Pipeline maintenance, format conversion, storage management | Full-time |
| Hardware Tech | 1 | Robot maintenance, camera calibration, station setup | Full-time |
タイムライン: 6つのロボットステーションが1日2シフトで動作し,平均吞吐量は6つの可用デモ/h/ステーションで,原料収集率は約430個 (休憩,リセット,校正セッション,ハードウェアダウンタイムを考慮する) です. 50,000個のデモには,ハードウェアの問題に対するアンプアップ,プロトコル繰り返し,バッファーを含む約116個労働日が必要です.
Hardware: 6 OpenArm 1 駅 ($4,500個) または相等リーダーフォロワー設定. 3台のカメラ (駅2腕 + 1オーバーヘッド).中央集成されたNAS最初の3ヶ月間,S3移行30TBマーク. 総ハードウェア予算:$35,000-50,000訓練のための計算を除く.
操作者の疲労管理
疲労は静かな品質殺手である.RCSVの生産データは一貫したパターンを示しています. デモンストレーション品質 (黄金標準からのDTW距離で測定) は,連続収集の90分後に15~25%低下する. 3時間後に品質は40%低下し,拒絶率は倍増する.これは意志力の問題ではありません. 持続的な微細な運動制御に対する神経学的制約です.
すべてのオペレーターに対して義務的な断断断プロトコル:
- 15分間の休憩は,90分ごとに (駅から離れて,コンピュータでデータを閲覧しない)
- 累積収集時間3時間後に30分間の休憩
- 労働時間: 労働時間: 労働時間: 労働時間: 労働時間: 労働時間: 労働時間: 労働時間: 労働時間: 労働時間: 労働時間: 労働時間: 労働時間: 労働時間: 労働時間: 労働時間: 労働時間: 労働時間: 労働時間: 労働時間: 労働時間: 労働時間: 労働時間: 労働時間: 労働時間: 労働時間: 労働時間: 労働時間:
- 腕の伸縮運動は,毎回休憩 (重複ストレスのリスクを軽減する)
作業員を8時間収集シフトに押し付けるため,一部のチームは努力します.これは反産です.過去2時間では収集コストが高く (流量低下) され,拒絶される可能性が高く (質量低下).適切な休憩で6時間のシフトの純利用可能輸出は,それらのなしでは8時間のシフトの純利用可能輸出を上回ります.
インフラストラクチャ:中央集権されたNAS対S3
集めたデータ50TB未満では,RAID-6を搭載した中央集権されたNASは,操作的にはよりシンプルで,月額約0.01$/GBとS3の0.023$/GBと比べて,かなり安くなります.
遅延を除くすべての次元でS3が勝利する.耐久性は最高のハードウェア冗長性に対して119です.専用データベースを回転せずにエピソードメタデータ上でSQLクエリをアテネに添付できます.そして,あなたは階層的なストレージを取得します. S3 標準でホットエピソード,S3 グラシアで完了タスクアーカイブは $0.004/GB/月で.
3つのパイプライン自動化ステップにより最大限の吞吐量向上がもたらされます. (1) 訓練準備の格式のための自動 HDF5~Zarr変換, (2) 感知性ハッシュによるエピソードデプリカリーション (同じ動きを再記録するコントローラ障害を捕捉する) そして (3) 探求のための PostgreSQL インデックスにメタデータ抽出 (オブジェクトポーズ,成功ラベル,オペレーター ID,期間)
規模のためのデータパイプラインアーキテクチャ
50K+のデモでは,データパイプラインは,人間の介入なしに,摂取,検証,注釈,保存,輸出を処理する必要があります.RCSVの生産の架構はこちらです:
ロボットステーション →録音エージェント (HDF5各エピソード) ↓ 飲み込みキュー (Redis) ↓ゲート 1: ヒューリスティック検証器 (Python,50ms/エピソード) ↓ 通過/拒否ゲート 2:成功分類器 (ResNet-18, GPU,200ms/エピソード) ↓ 通過/不確定/拒否 メタデータ抽出 → PostgreSQL インデックス ↓ オブジェクトストア (NAS → S3 at 50TB) ↓ 夜間パッチフォーマット変換器 (HRob5 → Zarr / Leot / RLDS) ↓ エクスポート API → クライアントダウンロード / HuggingFace プッシュ
キーデザイン原理:各ロボットステーションのレコーディングエージェントは,すべてのセンサーデータとメタデータを含む自立的なHDF5ファイルを書き込みます.パイプライン下流は,ロボットがオンラインになっていることに依存しない純粋にファイルベースの処理です.この脱離は,ハードウェアのダウンタイムがパイプラインバックログを生じないことを意味し,パイプライン問題は収集をブロックしないことを意味します.
試算額のコスト曲線
規模経済は現実的なものの,実現には意図的なインフラ投資が必要である. レベルシステムと自動化を前提に,各量で原料のデモコストは:
| Scale | Per-Demo Cost | Key Cost Driver |
|---|---|---|
| 100 demos | $80/demo | Setup amortization, no automation benefit |
| 1,000 demos | $45/demo | Pipeline automation kicks in, NAS amortized |
| 10,000 demos | $25/demo | Full tier utilization, S3 lifecycle savings |
| 50,000 demos | $16-20/demo | Cross-task operator scheduling, batch QA |
| 100,000 demos | $12–18/demo | Projected — requires dedicated QA software tooling |
設置コストとパイプライン開発を減額する際に 100~1,000回のデモの間で最も急激な減少が起こります. 自動化された品質分類が手動レビューの多くを置き換える十分な精度に達すると,次の意味のある傾斜は 5,000回のデモの間で起こります. 利益は主にオペレーター利用の改善から 増長セッション,タスクバッチング,クロスタスクオペレータースケジューリングから得られる.
隠れたコストはしばしば見逃されます:ハードウェアメンテナンス.50K+のデモでは,2000のデモごとにグリッパーパッドを交換する (15-50ドル/交換),毎月カメラを再校正する (20000ドル/ステーション技術時間) と,1万のデモごとに大きな腕修理の予算 (500-2,000ドル,合同に応じて) メンテナンスのための総収集コストの8-12%の予算を期待します.
始めること
従業員数よりも前に プロトコル文書と校正インフラに投資する 定義されていない プロトコルで2番目のオペレーターの限界コストは 追加価値よりも高い
RCSVの [データ収集サービス] (
独自の事業を構築するチーム: 1つの [OpenArm 1]
関連 読書
- [ロボット訓練データとは何か?] タイプ,品質基準,フォーマット比較
- ロボットデータアノテーションガイド -- ラベル付け基準とツール
- ロボットカメラセットアップ - 収集のための多カメラ設定
- [なぜテレオペレーションデータがシミュレーションに勝ったのか]
- RCSVデータサービス -- 2,500ドルから管理された収集
- OpenArm 1 -- $4,500リーダー・フォロワー収集ハードウェア
- ロボットリース -- 収集ステーションへの月間アクセス
- RCSVデータプラットフォーム --データ管理のためのパイプラインツール
データ収集を拡大する準備は?
RCSVは,プロのオペレーター,QAインフラストラクチャ,そして透明なコスト対示例価格設定により,ロボットデータ収集を管理します.
[データサービスを探求]







