Researchに戻る

測定ロボット示例データ品質:主要指標としきい値

訓練前ロボット遠隔操作の実証の質を評価する方法 <unk> 成功率,滑らか,覆い込み,多様性指標

[←研究]

政策の業績を予測するデータ品質指標 完全なトレーニングにコミットする前に達成する必要がある限界値

量より質量

過去3年間にわたる大規模な模倣学習研究から得られた最も重要な洞察は,政策実行のためにデータ品質が約1万回の示範まで支配するというものです. 1,000件の高品質の示範のキュレーティングデータセットは,行動クローン,ACT,または拡散政策を訓練する際に一貫して5,000件の騒音な示範よりも優れたパフォーマンスを発揮します.

対象数を達成するまで,オペレーターが収集し,その後データをトレーニングチームに渡す.この記事は,政策パフォーマンスを予測するメトリックと各主要なアルゴリズムに必要な限界を定義します.

任務の成功率

作業の成功率は最も重要な単一の指標です. データセットの示範の割合が 完成した動きではなく,本当に成功した作業を表現する割合を測定します.

  • バイナリー成功: 金基準 人間レビューは,各エピソードを見て,そのエピソードを書き換えに合格/失敗とラベル付けします. 規模で高価です (予算は0.10$~0.25$/エピソード) しかし,最も信頼できる信号です.
  • 部分クレジット項: 複雑な多段階の作業では,バイナリーラベルが情報を失います. 5ポイント項 (0:完全な失敗, 1:作業開始, 2:鍵介質達成, 3:ほぼ完成, 4:完全な成功) は,細かいデータセットのキュレーションを可能にします.訓練セットに34のスコアを付けているデモのみを含む.
  • 自動成功分類器: 規模のために,手動にラベル付けされた5001,000エピソードの種子セットでResNet-18またはCLIPベースの分類器を訓練する.残りのすべてのエピソードに適用する.よく定義されたタスクでは8592%の精度を達成する.常に新しい人間ラベル付けされたセットに対して分類器のパフォーマンスを検証する.

軌道の滑らしさ

滑らかなデモは,より滑らかな政策を訓練する.操作者の経験不足,遠隔操作遅延,または機械的な結合によって引き起こされる荒唐なデモは,政策が学ぶのに苦労し,部署で複製できる高周波の騒音を導入する.

  • Jerk メトリック: 時間に関する位置の第三の派生.各軌道のRMSジャークを計算する.良い操作者デモは,テーブルタップ操作のためにRMSジャーク < 2 m/s3を持っています.人間レビューのためにRMSジャーク > 5 m/s3を持つフラッグエピソード.
  • 速度差: 末効果の速度の高差 (軌道を横断する分子の変化系数として測定) は,躊躇と修正を示します.生産品質のデモの目標CV <0.6です.
  • 関節速度制限: 関節が最大限度な名乗速度の80%を超えたエピソードを拒絶する.

職場の範囲

初期条件がわずかに変化するときに,すべて同じ道を歩んでいるデモのみを訓練した政策は失敗します. 職場の覆盖面は,あなたのデモが関連する州空間をどの程度広げているかを測定します.

  • エンドエフェクター凸体の体積: データセット全体におけるすべてのエンドエフェクター位置の3D凸体の体積を計算する.理論的なタスクワークスペースと比較する.初期状態の差異が高いタスクに対して,対象>60%のカバーを対象とする.
  • オブジェクト位置覆盖: 集合中にオブジェクトの配置がランダム化されている場合,データセット内のオブジェクト開始位置の分布が意図された範囲全体に均等であることを確認します.カバー熱地図 (スタート位置の2D格列) は,隙間をすぐに表示します.
  • 軌道の長さの分布: 節目ごとに軌道の長さのヒストグラムを図 (ステップで) 描く.分布は単模的で広すぎない (CV < 0.4).二模分布はしばしば2つの異なる解決戦略を表示します 明確に処理することが重要です.

行動 多様性

行動多様性は,あなたのデータセットに様々な操作戦略が含まれているかどうかを測定します. これは,予期せぬ状態に対処できる訓練政策にとって重要です.

  • **アクションエントロピー:**アクションスペースを分別し,アクション限界分布のエントロピーを計算する.低エントロピーにより,ほとんどのデモはほぼ同一のアクションシーケンスに従っていることを示唆します.
  • **各オペレーターによる多様性:**同じオペレーターから異なるオペレーターに対してすべての軌道のペア間のペア式DTW距離マトリックスを計算する.オペレーター内の一貫性が高いのは良い.オペレーター間の多様性低いことは,すべてのオペレーターが同じ戦略を開発し,一般化を制限することを示唆する.
  • Grasp pose diversity: 作業の把握のために,各デモの把握接触時にグリッパーの方向性を抽出します. SO (SO) (3) 球面の分布を図示します.良いデータセットは,単一の定向上のダウングリッパーではなく,さまざまなアプローチ角度をカバーします.

人体一貫性スコア

このメトリックは,操作者間で示範がどれだけ複製可能か測定します 作業仕様が明確で達成可能かどうかに対する代理です.

  • オペレータ間協定: 各オペレータの成功率を別々に計算する.各オペレータ間の差異 (σ2 の各オペレータ成功率) は低いべきである.高い差異 (σ > 0.15) は,作業指示が曖昧であるため,または一部のオペレータが再訓練を必要とすることを意味します.
  • 金標準の類似性: 共同軌道をDTWを用いた金標準セットと各事業者のデモを比較する.平均DTW距離が2×金標準の中位数>の事業者は再訓練候補である.

自動化品質パイプライン建築

質の評価は 自動化されなければなりません 推奨されたパイプラインは,各食用エピソードを4つの連続的なゲートで実行します

  • ゲート1 図とセンサーの検証: HDF5 図をチェックし,カメラのフレームが空白でないことを確認し,プロピオセプションデータ範囲を検証する.技術的欠陥のために~25%のエピソードを拒絶する.
  • ゲート2 運動フィルター: 共同制限チェック,速度制限チェック,期間制限. 拒否 ~510%
  • ゲート3 滑らかなフィルター: RMS 揺れと速度差の限界.操作者の経験に応じて~515%を拒絶する.
  • ゲート4 成功分類器: MLベースの成功予測.典型的な作業では~1525%を拒絶する.分類器によってマークされたすべてのエピソードは自動的に削除されるのではなく,人間のレビューキューに送られる.

アルゴリズムによる品質の限界値

Algorithm Min. Success Rate Max. Jerk (RMS) Min. Demos (typical task) Sensitivity to Noise
動作のクローン作成 >85% <3 m/s³ 500–2,000 High — averages modes
ACT (Action Chunking) >80% <4 m/s³ 200–1,000 Medium — CVAE handles multimodality
Diffusion Policy >70% <5 m/s³ 300–1,500 Low — diffusion models multi-modality
IBC (Implicit BC) >80% <4 m/s³ 1,000–5,000 Medium
GAIL / adversarial IL >75% <5 m/s³ 500–3,000 Low

これらの限界値は保守的な出発点です.あなたの特定のタスク,ロボットプラットフォーム,環境には経験的校正が必要になります.あなたの品質メトリックとポリシーパフォーマンスを一緒に記録し,実際にあなたの使用事例に予測可能なメトリックを特定することができます.

RCSV データプラットフォーム は,すべてのエピソードで自動的にこの品質パイプラインを実行し,データセットレビューのためにメトリック単位ダッシュボードを提供します.

品質保証の示例データ

RCSVの各データセットは,完全な品質報告を提供します 成功率,スムーズ度指標,覆盖地図,オペレーター一貫性スコア.訓練の限界を満たさないデータは提供されません.

データサービスを見る →