ロボット の 訓練 データ は 何 です か
ロボット訓練データは物理的なAIの瓶頸です ロボットデータの種類,収集方法の比較,重要な品質基準,そしてチームが行う一般的なミスを学びましょう
言語の大きなモデルにはインターネットがありました 自律運転車には 何百万キロの記録的な運転がありました 物理的なAI - 物体を操作し,製品を組み立て,人間と一緒に作業するロボット - はデータ問題があります ロボット訓練データは同時に最も重要な入力であり パイプライン全体の最も難しいボトルネックです このガイドでは ロボットトレーニングデータとは何か 存在する種類 チームがどのように収集するかを 分析し 数据セットを信頼性の高いポリシーと 数ヶ月間かけて工程作業を無駄にするデータセットを分離する品質基準を 分析します
ロボット訓練データ定義
ロボット訓練データは ロボットが任務を遂行する記録されたエピソードで構成されています. それぞれのエピソードでは,センサーデータの同期ストリームを捕捉します. カメラ画像 (RGBと深さ),関節位置と速度,エンドエフェクターポーズ,グリッパー状態,トーク力読み取り,およびそれらの動きを生成した制御入力. 演劇は通常 10~60秒で 完成した作業を代表するものです 物体を掴み 目標地点に移動し 解放する
このデータは, [模倣学習] (
ロボット訓練データは,インターネットから取り除くことができないため,このようなボトルネックである.すべてのエピソードには,技術のある人間操作員または慎重に脚本化されたコントローラーが物理環境で動作する物理的なハードウェアが必要です.収集率は,1秒にエピソードではなく,1時間あたりで測定されます. 典型的な研究データセットには 100~10,000個のエピソードが含まれます 言語や視覚モデルを動かすデータセットよりも 大きさの順序が小さいのです
ロボット訓練データの一種
デモデータは最も一般的なタイプである.人間操作者は,遠隔操作または運動学習を通じてロボットを制御し,ロボットはセンサーの流れと結果的な行動を記録する.デモデータは,観察から政策が学ぶ必要がある行動までのマッピングを直接把握する. 模倣学習の黄金基準であり,ほとんどのデータ収集プログラムの主要な出力です.
インタラクションデータは,ロボットが自律的にポリシーを実行し,結果を記録するものを捕捉します.このデータには成功と失敗の両方が含まれ,オンライン強化学習,DAgger型の繰り返す改善,故障モードの識別に使用されます. 相互作用データは通常,各エピソードごとに示範データよりも品質が低いが,継続的な人間の注意を必要としないため,より大きな量で収集することができます.
物理エンジンであるNVIDIA Isaac Sim,MuJoCo,Genesisは,シミュレーションされたロボットがタスクを実行する仮想環境をレンダリングします. 合成データは無制限の量と完璧な注釈を提供しますが [sim-to-real gap] (T2
ビデオデータは人間の活動から 記録されています 料理のビデオ,組み立ての指示,操作の示例です ロボットがいなくても撮影されています ビデオデータはインターネットで豊富ですが 動作のラベルが欠けているのです (ロボットが行動を再現するために必要なモーターのコマンド) ロボット政策を直接訓練するのではなく [前訓練視覚表現] (T3
データ品質の次元: 利用可能なデータとノイズを区別する
すべての示範は平等に作られていません. RCSVで数十回のデータ収集キャンペーンで取り組んだ後,データセットが導入可能な政策を訓練するか,数ヶ月ものエンジニアリングの努力を無駄にするかを予測する 6つの測定可能な品質次元を特定しました.
1 実証一貫性
一貫性は,同じ条件下での同じ作業の示範において行動軌跡がどの程度似ているかを測定する.数学的に,この距離を計算することで測定できる. 校正作業のオペレーター間で 0.15未満のCVは一貫性を示します. 0.30以上はポリシーを混乱させるプロトコル漂移を示します.
矛盾は,操作者のスキル差異と曖昧なタスク定義から2つの原因から生じる.RCSVは,週に1回の校准セッションを伴う構造化された [操作者の訓練プログラム] (
2\ 失敗モードのカバー
清潔で成功したデモのみを含むデータセットは,未経験のほぼ失敗状態をみていないポリシーを作成し,その1つから回復することはできません.最良のデータセットには,復旧デモの制御された割合が含まれます.オペレーターは意図的にわずかに間違ったポーズからスタートし,オブジェクトを落として再接し,またはタスクの中間での誤った調整を修正します. 復旧デモの90/10の割引は,良いスタート比です. 復旧エピソードをメタデータでタグ付けして,トレーニング中に別々に重量化できます.
失敗の記録とタグ付けは同様に重要です. 500 の成功と 100 のタグ付け失敗のデータセットは 600 の成功よりも価値があります. なぜなら,失敗エピソードによってバイナリー成功分類者を訓練し,タスク分布の境界を定義し,対照的な学習アプローチのネガティブな例を提供できるからです.
3. 任務分布の範囲
作業分布は,ポリシーが展開時に遭遇するすべての開始条件,オブジェクト構成,環境変動の空間である.データセットは,この空間を,ad hocではなく,体系的にサンプルする必要があります.収集前に,変異軸を明示的に定義します.
| Variation Axis | Minimum Coverage | Example Values |
|---|---|---|
| Object instances | 10+ per category | 10 different mugs, 12 different cans |
| Starting positions | Full workspace coverage | 5x5 grid across 40cm x 40cm workspace |
| Object orientations | 4+ orientations per object | 0, 90, 180, 270 degrees; upright and on side |
| Lighting conditions | 3+ conditions | Overhead fluorescent, side lamp, natural daylight |
| Background scenes | 3+ backgrounds | Clean table, cluttered workspace, different table color |
| Operators | 3+ operators | Distinct control styles, response speeds |
| Distractor objects | Present in 30%+ of episodes | Non-target objects in workspace |
総エピソード数は,カバー要件から導き出される. 特殊条件ごとに10エピソードが必要で,10オブジェクト×5ポジション×3照明条件があれば,最低データセットサイズは1,500エピソードです. これは床ではなく天井です.
4 時間の質
演示中に操作者の躊躇,休憩,逆転は,動作分布に騒音を導入する.ピックアンドプレイスタスクを実行する熟練した操作者は,滑らかな8秒経路を生成する.同じタスクを実行する初心者操作者は,3〜4秒間の休憩と方向逆転で25秒経路を生成する. 初心者デモは遅いだけでなく,慣習を停止と逆転させるというものです.これはたいてい望ましい行動ではありません. タイムカワリティフィルタリングは,作業の平均期間が合計期間が作業の平均期間を2倍を超えたデモを削除します.または速度プロフィールが特徴的な躊躇パターンを示している場合 (作業中500ms以上ではゼロに近い速度).
5.センサー同期化品質
マルチカメラセットアップと混合センサーストリーム (カメラ + 合体状態 + フォース / トーク) は,緊密な許容範囲内に同期する必要があります.30Hz画像ストリームでは,単一の落下フレームでさえ,観察とアクションを誤った調整する33msのギャップを作成します. 1kHzで記録されたフォーストークデータでは,F/Tセンサーとカメラドライバーの間の時計漂流は60秒間のエピソードで数百ミリ秒まで蓄積できます.RCSVの収集パイプラインはハードウェア誘導同期 (Intel RealSenseハードウェア同期) を使用し,各録音セッションの終わりにインターストリームタイムリングを検証します. 10msを超えた同期エラーが発生したエピソードは再収集のためにマークされます.
6 行動空間忠誠性
記録されたアクションは,制御器が命令したものをではなく,ロボットが実際にやったことを忠実に表現しなければならない.リーダー・フォローワー・テレオペレーションシステムでは,フォローアームはリーダーを20-50ms遅らせ,関節制限,トーク制限,動力反応のためにリーダーの軌道を完璧に追跡することができない. 実行されたアクション (フォロワー) の代わりに命令されたアクション (リーダーから) を記録することは,体系的な偏見を導入します.常にフォロワーの実際の共同状態とエンドエフェクターをリーダーの命令ではなくアクションラベルとして記録します.
規模 測定 法: どれ程 の 証明 が 必要 です か
データセットサイズとポリシーパフォーマンスとの関係は予測可能なパターンに従いますが,正確な数字はタスクの複雑性,ポリシーアーキテクチャ,およびデータ品質に依存します.公表された結果とRCSVの内部基準に基づいて,以下は実践的なガイドラインです:
| Task Complexity | Example | Demos for 70% Success | Demos for 90% Success | Policy Architecture |
|---|---|---|---|---|
| Simple pick-place (1 object) | Pick block, place in bin | 30-50 | 100-200 | ACT |
| Multi-object pick-place | Sort 5 objects into bins | 150-300 | 500-1,000 | Diffusion Policy |
| Contact-rich single task | Peg insertion, lid closing | 100-200 | 300-500 | Diffusion Policy + F/T |
| Bimanual coordination | Fold towel, open bag | 200-400 | 800-1,500 | ACT (bimanual) |
| Language-conditioned multi-task | "Pick the red cup," "stack blocks" | 500-1,000 per task | 2,000-5,000 per task | VLA (OpenVLA, RT-2) |
| VLA fine-tuning (pre-trained) | Adapt OpenVLA to new task | 50-100 | 200-500 | OpenVLA + LoRA |
最近のスケーリング研究から得られた重要な洞察:多様性を恒常保持しながらデータセットのサイズを倍増すると,最初の200-300話以降の収益が減少する.恒常的な総エピソード数で多様性 (より多くのオブジェクト,より多くの条件) を倍増することは,ほぼ常に政策のパフォーマンスを倍増するよりも多く改善します. RCSVの [データ収集プロトコル] (
データ フライホイール: 収集から継続的な改善へ
最も先進的なチームは データ収集を 一回目的なイベントとして扱わない. データフライホイールを構築します 継続的なループです. 導入されたポリシーが新しいインタラクションデータを生成し,そのデータはレビューされ,注釈され,次のトレーニングの繰り返しに戻ります フライホイールは4つの段階があります:
第1段階:データセットを種植する. 遠隔操作を通じて200〜500件の高品質のデモを収集する.初期方針を訓練する.これは,不完全であっても政策を実行させる最低可行データセットです.
ステージ2:ログ付けによる展開. 完全なセンサーログ付けを有効にすることで,実際の作業に関する初期ポリシーを展開します. 失敗を含むすべての自動実行が記録されます. ポリシーが失敗すると,人間のオペレーターは監視し,介入します (DAgger型修正).
第3段階:故障対象集合. システム的な故障モードを特定するためにログインされたデプロイメントデータを分析する.故障条件を特定した追加のデモを収集する.暗色のオブジェクトでポリシーが失敗した場合,暗色のオブジェクトで50回のデモを収集する.ターゲットが作業場の端に近づいているときに失敗した場合,端位置で50回のデモを収集する. 標準的なデータ増強よりも 5-10倍効率的です
ステージ4:リートレーニングとリピート. 対象データと元のデータセットを統合し,リートレーニング,再配置する.フライホイルの各サイクルにより,最も弱いパフォーマンス領域で測定可能な改善が生まれます.フライホイルの35回繰り返しを実行するチームは,通常,最初の大きなデータセットで1回トレーニングするチームよりも1525%高い成功率を達成します.
データフライホイルの構築には,継続的なログ,自動故障検出,迅速な再訓練のためのインフラストラクチャが必要です.RCSVの [データプラットフォーム]
収集方法 の 比較
テレ操作は高品質の操作データ収集の主要な方法である.オペレーターはリーダーフォローアセットアップ,VRコントローラー,スペースマウス,データグローブを使用してロボットを遠隔操作します.ロボットはすべてのセンサーストリームを記録しながら,リアルタイムでオペレーターのコマンドを実行します. 遠隔操作は,操作者がそれぞれの状況にリアルタイムで戦略を適応できるため,よく一般化する自然的な流動的な示範を生産する.作業の複雑性とリセット時間に応じて,収集率は1時間に30〜120話までです.主な欠点は,操作者の疲労です.長時間セッションの後,品質は低下し,操作者はトレーニングを必要とします.
キネステティック・教学は,ロボットが適合 (重力補償) モードにいる間に,ロボット腕を望ましい動きで物理的に導いて操作する.操作者はエンドエフェクターやハンドルを握って,作業軌道を移動します. この方法は直感的で,外部制御ハードウェアを必要としないが,重要な制限があります:操作者の手がカメラのビューから作業空間を遮ります.操作者がロボットの惰性と戦っているため,力適用は不自然なものです.この方法は双手またはモバイル操作作業にスケールされません. 運動学的な教えは,正確な接触動力よりも軌跡形が重要である単純な単腕のピックアンドプレイスタスクに最も効果的です.
スクリプト・コレクションは,先決された動き原始的な方法 - 接近点,把握パターン,配置配列 - をランダム化されたパラメータで実行します.スクリプトは,大量のデータを生成できます (自動リセットで時間あたり数百回のエピソード), しかし動き戦略が固定されているため,多様性低いデモを生成します. 脚本化されたデータは,既知の物体によるビンのピックアップなどの構造的な作業のポリシーを初期化するのに有用であるが,新しい状況に一般化することは稀である.ほとんどの生産データセットは,コンタクト豊かなまたは構造化されていない部分のために脚本化された作業の収集とテレ操作を使用する.
ビデオ模倣は,手追跡,ポーズ推定,ロボット動力学へのリターゲティングを使用して録音された人間のビデオから示範を抽出する.このアプローチは,まだほとんど実験的である.粗い腕の動きではかなりうまく機能しますが,手ポーズ推定が十分に正確ではなく,人間からロボットへの実施形態マッピングがエラーを導入しているため,微妙な操作では失敗します. ビデオ模倣を調査するチームは,ロボットのネイティブデータ収集の補充として扱わなく,代替すべきです.
収集方法比較表
| Method | Throughput | Data Quality | Hardware Cost | Best For |
|---|---|---|---|---|
| Leader-follower teleop | 5-12 demos/hr (expert) | Highest | $4,500-32,000 | Dexterous, contact-rich tasks |
| VR controller teleop | 8-15 demos/hr | High | $500-1,500 | Pick-place, general manipulation |
| Kinesthetic teaching | 3-8 demos/hr | Medium | $0 (uses robot) | Simple trajectories, prototyping |
| Scripted + randomized | 60-200 demos/hr | Low-medium | $0 (software) | Structured tasks, pre-training |
| Video retargeting | N/A (post-hoc) | Low | $0-500 | Visual pre-training only |
質量 の 重要 な 要因
複数のエピソードが1つの要素として最も重要である.15つのオブジェクトインスタンスをカバーする200エピソード,3つの照明条件,および3つのオペレーターを含むデータセットは,ほぼ常に,1つのオブジェクトで2000エピソードよりも優れたポリシーを生成します.多様性は特定の視覚パターンを記憶するよりも,課題概念を学ぶように政策を強制します. 強力な操作データセットには,少なくとも10個以上のカテゴリーごとに異なるオブジェクトインスタンスを,3個以上の照明条件,全作業空間における異なるスタートポジション,複数のオペレーターを含む必要があります.
一貫性は,すべてのエピソードにおいて成功基準,リセット手順,タスク定義が同一であることを意味します.一部のエピソードでは,ほぼ失敗が成功すると考え,他のエピソードでは,正確な配置が必要だと考えれば,ポリシーは曖昧な目標を学ぶ. 一貫性には書面の収集プロトコル,操作者が明瞭に適用できる明確な成功基準,およびエピソード間の標準化されたリセット手順が必要です
注釈正確性は,各エピソードに付属するメタデータ (成功/失敗ラベル,言語指示ラベル,タスクフェーズセグメント,オブジェクトアイデンティティタグ) をカバーする.誤った注釈はトレーニング信号を損なう.二元成功ラベルは,境界線ケースについては,第2のレビュー者によって検証されるべきである.言語指示は,実際のタスク行動と対照的にチェックされるべきである. RCSVのパイプラインには,すべての境界線症例の人間によるレビューによる自動化された成功分類が含まれています.
エピソード完全性は,すべてのセンサーストリームが同期され,フレームが落下されないように,最初のアプローチから最終的な配置までのすべてのエピソードが完全なタスクを捕捉することを意味します. 完全でないエピソード - 録画が中途半端に開始されたとき,カメラストリームが落下したとき,または画像よりも異なる周波数で結合状態が記録されたとき - 政策学習を劣化させる騒音を導入します. シンクロニゼーション検証は,収集パイプラインのすべてにおいて自動化すべきです.
チームが最初のデータセットを収集するときに犯す一般的な間違い
多種多様なエピソードを多く収集する. チームはしばしば多種性を制御せずにエピソード数値目標 (1,000エピソード) に集中する.結果として,大量のデータセットが悪事に過失する. 対象例数,環境,操作数など 多様性目標を設定し その目標から 総エピソード数を条件ごとに最小値に倍にして 実行させてください (通常は1条件ごとに10〜20エピソードです).
Skipping operator校正. 未訓練のオペレーターは,政策のパフォーマンスを積極的に損なう不一致なデモを生産する.新しいオペレーターごとに,データセットにカウントされる前に,テレオペレーションインターフェースを練習するために 2-4時間割り当てます.各オペレーターに品質メトリックを追跡し,フィードバックを提供します.
**失敗エピソードを記録しない.**失敗したデモは記録しタグ付けされるべきであり,捨てない.失敗データは,復元行動のトレーニング,即日失敗を検出するための分類器を構築し,あなたの作業が最も難しい場所を理解するために価値があります.模倣学習トレーニングセットから失敗したエピソードを捨てて,分析のためにアーカイブします.
リセット一貫性を無視する. エピソード間のリセットが不順である場合 - およそ同じ場所に配置されたオブジェクト,以前の試験から残った背景混乱 - データセットはシステム的な偏見を受け継ぐ. 既定領域内のランダム化されたオブジェクト配置,一貫した背景状態,およびエピソード間の操作者が追跡するチェックリストを含む繰り返しリセットプロトコルに投資する.
間違ったフォーマットを選択する. データをカスタムフォーマットで保存することは,下流消費者の間で摩擦を引き起こします.既定フォーマットである HDF5 または Zarr を使用して原始エピソードデータ,共有用の [LeRobot HuggingFace 形式]
注釈に投資を怠る. 多くのチームは言語注釈を完全にスキップしたり,コピーペーストされた同じ指示でエピソードをラベル付けしたりします.言語条件のポリシーを訓練したり,VLAを細かく調整したりする計画がある場合は,エピソードごとに何が起こったかを正確に記述するユニークな自然言語の指示が必要です. "テーブル左側から赤いカップを拾って青いプレートに置く"は有用な注釈です. "ピックアンド・プレイス"はありません.詳細な基準については, [注釈ガイド]
データ形式と輸出基準
ストレージ フォーマット の 選択 は,パイプライン の ダウンストリーム の どの ステップ に も 影響 を 及ぼします.
| Format | Strengths | Weaknesses | Best Use Case |
|---|---|---|---|
| HDF5 (.h5) | Random access, chunked compression, metadata support, mature tooling | Single-writer lock, poor cloud streaming, no built-in versioning | Local collection, ACT/Diffusion Policy training |
| Zarr | Cloud-native, concurrent writes, chunk-level access, S3/GCS compatible | Less mature ecosystem, no single-file portability | Large-scale cloud datasets, Diffusion Policy reference implementation |
| RLDS (TFRecord) | Streaming, Open X-Embodiment standard, TF ecosystem integration | TensorFlow dependency, no random access, sequential read only | Cross-embodiment sharing, OXE compatibility |
| LeRobot (HuggingFace) | Standardized schema, Hub integration, streaming via datasets library, growing community | Parquet overhead for small datasets, Hub dependency for sharing | Community sharing, LeRobot framework training, VLA fine-tuning |
| ROS bag (.bag / .db3) | Native ROS logging, preserves topic structure, replay support | ROS dependency, not ML-ready, needs conversion for training | Raw collection on ROS2 systems, debug replay |
RCSVの推奨事項:収集段階において最大限の柔軟性のために HDF5または ROS袋で収集し,共有およびトレーニングのためにLeRobotフォーマットに変換します.当社の [データプラットフォーム]
政策型による注記要件
異なる政策構造では,注釈層が異なる.廃棄物を注釈不足が将来の機会であり,廃棄物を注釈過剰とする現在の予算である.注釈投資を計画された訓練パイプラインと一致させる:
ACT / Diffusion Policy (単一のタスク): バイナリー成功フラグは,エピソードごとに.オプション:デバッグのためのタスクフェーズセグメント.言語ラベルは必要ありません.注釈コスト:0.02-0.05 $,エピソード.
言語条件BC (BC-Z, RT-1): バイナリー成功フラッグと自然言語の指示をエピソードごとに.指示はタスクのバリエーションを区別する必要があります.注釈コスト: $0.10-0.25 /エピソード.
**VLAの微調整 (OpenVLA, RT-2):**バイナリー成功フラッグ,自然言語の指示,理想的にはタスクフェーズセグメント.言語の指示は,モデル言語の通用化を教えるために,フレーズで多様化 (コピーペスト) されるべきである.注釈コスト:エピソードあたり0.25-0.50ドル.
階層的ポリシー: 作業の成功フラグを付いた完全なタスクフェーズセグメント.各フェーズ境界にはタイムスタンプラベルが必要です.注釈費用:タスクの複雑さに依存して,エピソードあたり0.50-2.00ドル.
詳細な注釈ガイドラインとツール・ド・リッセンシングについては, [ロボットデータ注釈ガイド] (
RCSVデータサービスでスタート
ロボット訓練データプログラムをゼロから構築するにはハードウェア,オペレーター,ラボ環境,収集ソフトウェア,品質保証ツール,データエンジニアリングの専門知識が必要です このインフラストラクチャを構築するよりも早くデータを必要とするチームにとって RCSVの [データサービス]
作業説明,ターゲットロボットプラットフォーム,および望ましいエピソード数値についてデータサービスチームに連絡することが最も早い方法です.RCSVは収集プロトコル設計,オペレータートレーニング,データ収集,品質保証,注釈,およびあなたの好みのフォーマットで輸出を処理します. 施設で RCSV レンタルされたハードウェアを使用したリモート収集は,特定の環境またはオブジェクトを必要とする作業にもサポートされています.
プロジェクトに"000件をかけて 作業の定義と品質基準を検証する 200~500話のパイロットキャンペーンから始めましょう. このパイロットアプローチでは,誤ったプロセスに数週間の収集時間を投入した後にではなく,早期に,修正が安くなったときにプロトコル問題を発見します. RCSVのパイロットプログラムは2,500ドルから始まり,プロトコル設計,200回のデモ,品質報告,および選択したフォーマットで輸出を含む.生産データセットの完全なキャンペーンは8,000ドルから始まり,量とともにスケールされます.
ハードウェアオプションには, [OpenArm 1] (
関連 読書
- [ロボットデータアノテーションガイド]
T17 ) - 訓練のためのデモを標籤にする方法 - [スケーリングロボットデータ収集チーム] (T18
) -- 1Kから100Kまでのデモ - データ収集のためのロボットカメラ設定 -- 手首,オーバーヘッド,ステレオ設定
- [ロボット学習の拡散政策]
T20 ) -- データ要件と訓練設定 - VLAモデル説明 - デモデータによる精細調整
- [なぜテレオペレーションデータがシミュレーションに勝ったのか]
- RCSVデータサービス -- 2,500ドルから管理されたデータ収集
- [公開データセット] (T24
) - 既存のロボットデータセットを閲覧する - [ロボットリース] (T25
) -- 収納ハードウェアへの月間アクセス







