ロボット の 訓練 データの 良さ は 何 です か
ロボット訓練データ品質のための実用的な枠組みです 多様性,一貫性,完全性,正確性,バランス,フォーマットという 6つの次元と 10点チェックリストです
[←ブログ]
平均的な2千台以上の 性能が常に優れている 200個の優れたデモです 差は 6つの測定可能な質量に 引き込まれます
ロボット 政策 の ごみ出し の問題
模倣学習は分布の匹配の問題である.訓練された政策は,トレーニングデータにおける行動分布を近似する.その分布には失敗した把握,不規則な動き,不一致な戦略,曖昧な成功基準が含まれている場合,政策は,それらをすべて忠実に複製することを学んでいます. 言語モデルトレーニングとは異なり 単一の騒音例は 他の何十億もの例によって平ら化されます [ロボット示範データセット]
慎重に制御されたデモ500のデータセットは 5,000の制御されていないデモのデータセットよりもより良い政策を生み出します これは野望の主張ではありません 研究グループ,タスクタイプ,政策アーキテクチャの間で一貫した経験的発見です 説明は簡単です 清潔で多様で一貫したデータセットは政策に何を学ぶべきかを明確に示します 騒音や偏見や不一致なデータセットは 政策に混乱した信号を与え 矛盾する行動を平均して解決します 何にでも強いパフォーマンスを出すのではなく すべてに中等なパフォーマンスを生み出します
下の枠組みでは,高品質なロボット示例データと中等的なデータとの区別を図る6つの次元を特定します.各次元には測定可能なメトリックと実用的な限界があります.
次元1: 多様性
多様性とは,最も重要な品質次元である.それは直接決定するため (政策がどの程度一般化する)
オブジェクト多様性: 各対象物品カテゴリーの少なくとも10〜20個異なる例を含め,サイズ,色,材料,ブランドによって異なります.あなたの任務はカップを拾う場合,陶器のカップ,紙カップ,プラスチック旅行カップ,ガラスカップ,金属カップで示例を収集してください.各例は,カテゴリーの視覚的および物理的特性について政策に異なることを教えます.
位置多様性: 作業スペースの全範囲で異なるオブジェクトのスタート位置を,少なくとも30 x 40cmのグリッドを使用して.異なる方向を含め - 直立,傾斜,90度回転.訓練中に作業スペースの中心にあるオブジェクトのみを表示した場合,展開中に端に失敗します.
**照明の多様性:**少なくとも3つの異なる照明条件下で収集します:温かい空頭
オペレーター多様性: 少なくとも3つの異なるオペレーターを使用し,それぞれがほぼ同じ示範を担う.各オペレーターは,異なるアプローチ角度,把握点,速度,および回復戦略など,異なる方法で作業に取り組んでいます.この多様性は,政策が単一の人の異性ではなく,作業構造を学ぶことを強制しているため,価値があります.
次元2:一貫性
一貫性とは,すべてのエピソードにおいてタスク定義,成功基準,リセット手順が同一であることを意味します.不一致性によって,政策が解決できない曖昧さが生じます.
成功基準は二重で曖昧である必要があります. 選択と場所の課題では,成功とは,エピソード終了時に定義された許容範囲内で対象位置に存在することを意味します. "十分に近い"は基準ではありません. 集合プロトコルに成功基準を書き込み,すべてのオペレーターが同じ方法で適用していることを確認してください.
リセット手順は標準化されなければならない. エピソードの間,オブジェクトは定義されたランダム化プロトコルに従って新しいスタートポジションに配置され,作業場は以前の試験からの残骸や移動から清掃され,ロボットが一貫したスタート設定に戻らなければなりません. 落書きリセットは システム的な偏見を導入します 特定の場所の近くに 蓄積される物体は 操作者がそれを設定する際に 設定していないため 劇情を横切る背景混乱です
オペレーター校正は必須です. データセットに示範を数える前に,オペレーターは2~4時間の校正セッションを完了し,遠隔操作インターフェースを学び,成功基準を内化し,一貫したアプローチ戦略を開発する必要があります.オペレーターごとに品質メトリック (成功率,軌道の順調性,エピソード期間) を追跡し,フィードバックを提供します. 計測されていない事業者は,政策の実行に積極的に害を与えるデモを展開する.
3 面目: 完全性
初期アプローチから最終リリースまでのすべての作業をすべて把握し,すべてのセンサーストリームが同期され,データがないようにする必要があります.不完全なエピソードは,事実後に診断が難しい微妙な方法でトレーニング信号を損なう.
欠けているモードはありません. 収録設定には2台のカメラ,コイントエンコーダー,フォース・トークセンサーが含まれている場合,各エピソードには4つのストリームも含まれなければなりません. 落下したカメラフィードを持つ単一のエピソードでは,欠けているカメラが時にはゼロであるというポリシーが教えられ,視覚処理パイプラインを混乱させる.
同期タイムスタンプ. すべてのセンサーストリームは制御期間内 (通常5~20 ms) に時間調整する必要があります.不一致するストリームはロボットが見ていることと行うこととの間を不一致するマッピングを作成します.T時のアクションはT минус50 msからの観測と結合し,システム的にシフトされたトレーニング信号を生成します. タイムスタンプの配列をチェックすることで,同期を自動的に確認します.
完全エピソード記録. 記録が遅刻開始されたため (記録が遅刻開始されたため) または作業が完了する前に終了したエピソード (録音が早く停止されたため) は,ほとんどの政策訓練パイプラインでは使用できません.作業が開始する前に録音を開始し,ロボットが開始設定に戻った後に停止するように収集システムを設定してください.
次元4:正確さ
精度は,示例そのものの正確性とそれらに付属するメタデータの両方をカバーする.
示範精度: 模倣学習訓練セットには完全に成功したエピソードのみが含まれなければならない.失敗した示範を含むパフォーマンス効果は劇的に大きい - 訓練セットに失敗した示範を10%も追加すると,通常政策の成功率は20~30%低下する. 仕組みは明確です.政策は"ほぼ把握"または"半分を落とす"が受け入れられる終末状態であることを学びます. 厳密にフィルタリングします.
軌道の質: デモは滑らかで,意図的で,効率的に行われなければなりません.操作者のエラー,コントローラ遅延,またはワークスペースのエロゴニクスが悪いことによって引き起こされる,不器用な軌跡は,政策が不器用であることを教えてくれます. 滑らさを計測する"ジークメトリック" (関節位置の第三派生),最高のオペレーターからタスクごとに基線を設定し,その基線の70%未満のフィルター示例を測定する.
注釈の正確性: 成功/失敗のラベル,言語指示ラベル,タスクフェーズセグメント,オブジェクトアイデンティティタグは正しくなければならない.誤った注釈はトレーニング信号を損なう.言語指示は実際のタスク行動とチェックされるべきである ("赤いカップを拾い上げ"は,オペレータが青いボウルを拾ったエピソードでタグ付けされるべきではない). 自動認証ツールでは,注釈と観測の間の不一致を標的にすべきである.
次元5:バランス
均衡あるデータセットは,条件ごとにほぼ平等な表現を有します.不均衡は,政策が過度に表現された条件に過度に適合し,過度に表現されていない条件に劣等に導きます.
オブジェクトバランス: 15 つのオブジェクトインスタンスを持っているが,示例の60%が3 つを使用している場合,ポリシーはそれらの3 つのオブジェクトをうまく学び,他の12 項目は不十分学習します.オブジェクトインスタンスの均等な示例を目標にします.最も代表的で最も少数なインスタンスの間の比率は2:1 以上ではありません.
位置バランス: ほとんどのデモが作業場の中心にある物体から始まる場合,作業場の端ではポリシーが弱くなる.空間覆いを確保する定義されたグリッドまたはランダム化スキームを使用します.
困難度バランス: 試行中の約10~15%は,意図的に挑戦的なシナリオをカバーすべきです. 到達可能な範囲の端にある物体,混雑した作業場,異常な方向性,ほぼ失敗の回復.これらの端ケースは,比率的により多くのデータを必要とせずに,強さを劇的に向上させる. 限界ケースの表現不足は,意外な部署失敗の最も一般的な原因の一つです.
次元6: フォーマット
データフォーマットは,データセットが訓練パイプラインにどれだけ簡単に統合され,いかに効率的に保存・転送され,コミュニティ標準に適合しているか判断する.
既成フォーマットを使用. HDF5またはZarrは原始エピソードストレージのために使用します. LeRobot HuggingFaceフォーマット は共有とコミュニティ互換性のために使用します. 交叉体研究のためにX-Embodimentスキーマを開く.カスタムフォーマットは,下流消費者のために摩擦を引き起こし",私たちはデータを収集しましたが,それを使用できません"の失敗の主な原因です.
完全なメタデータを含む. 各エピソードには:タスク説明,成功/失敗ラベル,言語指示,ロボットプラットフォーム識別子,カメラ内部のおよび外部の情報,収集日,オペレーター識別子,および環境条件が異なるもの (照明設定,テーブル表面,オブジェクトインスタンスのID) が含まれる. このメタデータは,特定の条件でフィルタリング,層次分析,そして標的型再訓練を可能にします.
** フォーマットを自動的に検証する.** 書き込み時に各エピソードでスケーマの検証を実行する. ファイル収集中にフォーマットエラーを検出することは,エンジニアがエピソード 3,847 でデータロードが故障する理由をデバッグする時間を費やしているときに,トレーニング中に発見するよりもはるかに安くなります.
次元7 失敗の含有
この次元は直感に反する:良いデータセットには失敗示例の制御された割合が含まれています.Dimension 4 (精度) は,小学校の訓練セットから失敗を排除することを要求していますが,ラベル付きの失敗示例の別々のセットは,強力な政策訓練にとって重要な機能を提供します.
なぜ失敗が重要なのか. 成功したデモを専用的に訓練した政策は失敗の様子を表現していない.展開中に失敗に向かっている状態に出会ったとき,状況から認識したり回復したりするための訓練信号は存在しない. 誤差の示例を5〜10%に表示する (データセットのメタデータに誤差として明確に表示される) を含むことは,いくつかのトレーニング技術が可能になります.
- 対照的な学習: 政策を訓練して成功の軌道を失敗の軌道を区別し,より堅固な意思決定境界を確立する.
- 回復行動学習: 操作者がほぼ失敗状態 (落下物体,誤った握手) を遭遇し,回復するデモを含む.これらの"回復行動示例"は,物事がうまくいかないときに何をすべきか,ただ何をすべきかではなく,何が正しく行っているかを政策に教える.
- 失敗検出: 成功/失敗データに訓練された別々の分類器は,政策が失敗状態に入ると人間の介入を誘発する実行時間のモニターとして機能します.
故障データを収集する方法. デモンストレーションを意図的に破壊しないでください.代わりに,収集中に発生する自然故障を保存してください (各オペレーターは10-30%の故障率を持っています.特にセッション初期) 失敗モードのラベルを付けます"交通中に手遅れ"""手遅れ"""誤った配置""障害物との衝突" このラベルは政策の弱点を標的的に分析し,再収集優先事項を指針します.
推奨比: 基礎訓練セットで8590%の成功示例,510%の回復示例 (成功回復のほぼ失敗) と5%の純粋な失敗示例 (明らかに失敗の結果) 回復デモは 事件ごとに最も価値のあるものです なぜなら 政策が 状況が悪いとき 州の分布を扱う方法を教えるからです
データ品質スコアリングルイック
| Dimension | Score 1 (Poor) | Score 3 (Adequate) | Score 5 (Excellent) |
|---|---|---|---|
| Diversity | 1-2 objects, 1 lighting, 1 operator | 5-10 objects, 2 lightings, 2 operators | 15+ objects, 3+ lightings, 3+ operators |
| Consistency | No written criteria, ad-hoc resets | Written criteria, manual reset verification | Written criteria, automated reset verification, operator calibration |
| Completeness | Missing modalities in >5% of episodes | All modalities present, sync within 50ms | All modalities present, sync within 10ms, auto-validated |
| Accuracy | No filtering; includes failed demos | Binary success filter, basic smoothness check | Automated success classifier, jerk filtering, annotation validation |
| Balance | >5:1 ratio between most/least represented | 3:1 max ratio, basic spatial coverage | 2:1 max ratio, grid-based coverage, 10-15% edge cases |
| Format | Custom format, missing metadata | HDF5/Zarr, basic metadata | LeRobot/RLDS compatible, full metadata, auto-validated at write |
| Failure Inclusion | All failures discarded | Failures preserved but unlabeled | Labeled failures + recovery demos at 5-10% ratio |
平均スコアが4+で7次元を合わせるデータセットは生産品質です. 収集を拡大する前に,任意の次元で3のスコアを扱う必要があります.任意の次元で1-2のスコアは,政策訓練に積極的に害を与えるでしょう.
ロボットデータ収集における一般的な反パターン
これらの問題は,RCSVが政策訓練のために提出されたデータセットで最も頻繁に見られるものです.
- "研究生特典""操作員1人,照明条件1人,物体は常に同じスタート位置で,一日の午後間に収集されたデータ.結果となるポリシーは,実験室で完璧に機能し,他の環境ではすぐに失敗する.修正:すべての軸をはじめから多様化.
- "質量よりも質量"の罠. 5,000件のデモは,品質のフィルタリングなしでできるだけ早く収集されました. 30%は失敗した把握, 20%は疲れたオペレーターの不快な軌跡, 10%はタイムスタンプ同期の問題があります. 結果のポリシーはすべての行動の平均を学びます.それはすべて中等です.修正:最初にフィルタ,その後スケール.
- "デモ蓄積"の誤り. 単一のポリシーを訓練する前に2000個のデモを収集する.その後,データにはシステム的な問題があることが発見される (カメラの角度が間違っている,模様性が欠けている,成功基準が不一致) により,データセット全体を再収集する必要があります.修正:スケーリングする前にパイプラインを検証するために50-100個のデモで早期にテストポリシーを訓練します.
- **"簡単のみ"偏見.**操作者は,より速く,よりスムーズな示例を出すため,自然に簡単なスタートポジションやオブジェクト指向に重力する.データセットは,簡単な条件で過度に表示され,政策が展開時に遭遇するエッジケースでは過度に表示されなくなります.修正:明確に困難な条件を含む構造化されたランダム化プロトコル.
- ** "静かな故障"の問題.** 数週間データ収集が続いていますが,3日目にはカメラの校正が漂ってしまい,自動的な品質モニタリングが行われなかったため誰も気づかなかった.3日目以降のすべてのデータが体系的に間違った外在変換を持っています.修正:書き込み時に各エピソードの自動品質チェック.
- ** "フォーマット変換悪夢".** データをカスタムフォーマットで収集し,訓練のために HDF5 に変換する.変換スクリプトには10回ごとに滑る微妙なバグがあります.ポリシーは破損したデータに訓練され,展開に失敗します.修正:開始から既定フォーマットを使用し,各エピソードでスケーマを検証します.
RCSV品質保証パイプラインの詳細
RCSV QAパイプラインは集集計時に各エピソードで実行されます 集計処理後のステップとしてではなく 展示完了後数秒以内に品質の問題が検出され 操作者の即時フィードバックと再集を可能にします
管道ラインの段階:
- スケーマ検証 (0.1s). すべての必要なデータストリームが存在し,データタイプが正しいとエピソードメタデータは完了していることを確認します. ストリームが欠けている場合はすぐに拒否します.
- タイムスタンプ同期チェック (0.2s). すべてのセンサーストリーム間のタイムスタンプの対対調整を計算する. 10ms 以上 (タスクごとに設定可能) で誤ったストリームを拒否する.
- **成功分類 (0.5s).**学習した分類器 (同じ作業で以前に標識されたエピソードで訓練された) は成功/失敗を予測する.境界線予測 (信頼性0.4-0.7) は人間レビューのためにマークされる.
- 軌道の滑らしさスコア (0.3s). シャークメトリック (関節位置の第三次導体) を計算し,操作者の校准中に確立されたタスクごとに基線と比較する.70パーセント未満のエピソードがマークされる.
- カバー分析 (0.5s). 映像を視覚機能空間に埋め込み (前訓練の視覚エンコードを使用) そして既存のデータセットと比較して多様性を確認します.新しいエピソードが既存のエピソードにあまりにも似ている場合 (コシナス距離の限界以下) は冗長性としてマークされます.
- メタデータ完全性のチェック (0.1s). すべての必要な注釈フィールドが埋められていることを確認します:タスク説明,言語指示,オペレーターID,環境条件.
総QA遅延:各エピソードで2秒未満.操作者は,各デモを完了した直後に緑/黄色/赤の指標を表示し,収集流を断つなくリアルタイムで品質フィードバックを可能にします.
10ポイントデータ品質チェックリスト
- 対象カテゴリーごとに少なくとも10つの異なるオブジェクトインスタンスは
- 照明条件は少なくとも3つ
- およそ同じエピソードを担う少なくとも3人の事業者
- 記録的な成功基準は,すべてのエピソードに一貫して適用される
- 標準化されたリセットプロトコルが文書化され,従順
- すべてのセンサーストリームがすべてのエピソードで存在し同期されます
- 接近から完成までの全話撮影
- 境界線症例におけるヒトによる評価による二元成功分類
- ターゲート滑らかな方向性,タスクごとに基線にフィルタリング
- 既定形式 (HDF5/Zarr/LeRobot) で保存されたデータ,完全なメタデータ
信頼性の高い政策を訓練するのに適したデータです. 信頼性の高い政策を訓練するのに適したデータです. 信頼性の高い政策を訓練するのに適したデータです. 信頼性の高いデータを持つデータを持つデータも,同じ品質の問題を持つデータも,同じ問題をもう一つ生み出すのです.
RCSVが管理された収集における品質を保証する方法
[RCSVデータサービス]
質の証明されたデータを受け取ります 各エピソードに質のスコアがあり 総合的な報道統計はすべての軸に多様性を示し 質の報告が6つの次元ごとにデータセットのパフォーマンスを記録します この証明は データの標準を満たす自信を持って訓練できます 質の問題を発見するのではなく 訓練の3週間後に
RCSVは,独自の収集インフラストラクチャを構築するチームに対して,外部から収集されたデータセットの品質監査も提供します.私たちは同じ品質パイプラインをあなたのデータに適用し,どの次元が改善する必要があるかを詳細なレポートを提供します.
関連 読書
- ロボットデータ収集コスト - 品質第一のデータ収集のための予算計画
- [OpenArm設定ガイド] 初めてのデータ収集キャンペーンのためのハードウェアを設定する
- [LeRobotガイド]
T8 ) -- 品質認証されたデータセットに関するトレーニング方針 - [ゼロショット対少ショットロボットポリシー]
T9 - 数据の質が少ショットの微調整効率に影響を与える方法 - ロボットデータプライバシーとセキュリティ - 収集中に敏感なデータを責任を持って処理する
- [ロボットデータ市場の未来] (
T11 ) - 新たに登場するデータ市場を形作る品質基準 - RCSVデータサービス -- 自動化QAパイプラインによる品質認証データ収集
質の高いロボット 演示 を 取得 する
RCSVの質素パイプラインは 6つの次元をカバーします データの標準を満たす自信を持って訓練できます
[データサービスを探求]







