Researchに戻る

ロボット政策の失敗モード解析:訓練されたロボットの部署が失敗する理由

訓練されたロボット政策が失敗する方法を 体系的な分析 配分シフト,コバリアシフト,モード崩壊,回復戦略

[←研究]

ロボット政策の失敗モードの分類,実態環境に訓練された政策を展開する前に,それぞれの必須の読み方に対して緩和戦略を備えている.

なぜ 失敗 モード の 分析 が 大事 な の か

実験室評価で82%の成功を達成する政策は,展開で40~50%の失敗を遂げることができる.この差はランダムではない. 展開前に診断され,緩和された特定,識別可能な故障モードによってほぼ常に引き起こされる. ロボティクスチームが実行する前にシステム的な故障モード分析は,最もコスト効率的な品質投資である.

下記の故障モードは,根本原因によって組織され,診断信号 (このモードが故障を引き起こすかどうかを確認する方法) と緩和戦略 (データ,アーキテクチャ変更,または部署変更でそれを修正する方法) を含む.

障害モード1: 配信終了した視覚入力

症状: 実験室環境では,ポリシーがうまく機能しますが,新しい場所,異なる照明下で,またはわずかに異なるオブジェクトの外観 (新しい色変数,着用ラベル,異なる表面仕上げ) で導入されたときにすぐに失敗します.

  • 根本原因: 訓練データは狭い視覚条件で収集されました. 政策の視覚エンコーダーは部署環境で欠けている特定のテクスチャ,照明パターン,または背景にオーバーフィットされています.
  • 診断テスト: 3つの異なる照明条件 (上頭光と自然光と暗) で,20回の試験集計を収集し,テーブルの高さ2個 (±10cm) で,作業場に3つの分散器物置きます.
  • ミガージョン データ増幅: ランダムなカラージッター (明るさ ±30%,コントラスト ±30%,色彩 ±20%),ランダムな背景置き換え (ランダムな画像ネット背景に作業空間を貼り付け),ランダムな照明シミュレーションを用いた訓練画像増幅. 訓練時に原料画像から増幅を加え,焼いたりしない.
  • ミティゲーション 多様なデータ収集: 初期データ収集段階において複数の照明条件,テーブル表面,背景設定を示し集める. 5×コスト対単一の条件の収集,しかし劇的により強力な政策.
  • Mitigation ドメイン調整: 展開後,展開環境で50100のデモエピソードを収集し,ポリシーを細かく調整します.小さなドメイン特有の細かい調整セットでさえ,実質的にパフォーマンスを回復します.

失敗モード2: 複合エラー (BC コバリアートシフト)

症状: 政策は,任務を正しく開始するが,徐々に訓練で見られなかった異常な状態に漂う.その後,惨事に失敗する.条件が馴染みのない状況で,任務の初期に失敗がますます起こる. 行動クローン政策の伝統的なパターン.

  • 根源: 行動クローン (およびその変異) は,配布中の状態 (訓練経路で出現した状態) にのみ訓練されます. 小さな政策エラーがロボットを訓練の配布中の状態に移動し,より大きなエラーを引き起こし,訓練からさらに遠く離れた状態へと導いて,最終的に大惨な失敗します.
  • 診断テスト: 課題のタイムラインに沿って失敗が起こる状態の分布を図示します. 失敗が課題の後半に集まって,政策がより短い作業で成功した場合,複合エラーが原因です.
  • 減算 行動分解 (ACT): Hの将来のステップを予測する際は,政策はステップごとに反応するよりも一貫した軌道を計画するよう強要する. 複合を大幅に減少させる. [アクション分解の記事](T1参照).
  • ミリゲーション DAgger: データセットの統合.初回のトレーニングセットの後,ポリシーを導入し,ポリシーがエラーを起こしたとき,人間専門家ラベルの修正をしてください.これらのことをトレーニングセットに追加して再訓練します.人間専門家が政策展開を効率的に観察できる場合に最も効果的です.
  • ミティゲーション 拡散政策: 拡散によるアクションシーケンスの繰り返し否定は,単段階予測よりも早期実行エラーに強く,なぜなら,否定プロセスは暗黙に可視軌跡に再中心化しているからです.

失敗モード3:モード崩壊とモード平均

症状: 訓練データには複数の有効な戦略が存在します (例えば左から右に握る) しかし,ポリシーは戦略も戦略もでない間間隙の軌道を実行します.または:ポリシーは,任務状態に関係なく,常に同じ単一の戦略を実行し,その戦略がブロックされたときに失敗します.

  • 根源: 決定的政策の標準平均平方誤差訓練は,示範間の平均予測誤差を最小限に抑える.複数のモードが存在する場合,最小平均誤差予測はすべてのモードの平均である.これは有効な軌跡ではない.
  • 診断テスト: すべての訓練デモをレビューし,複数の異なる戦略が存在するかどうかを手動で確認する.操作者が質的に異なるアプローチ (異なるアプローチ角度,異なる把握タイプ) を使用した場合,モード平均は可能である.
  • Mitigation CVAE (ACT): ACTの条件 VAE(変分オートエンコーダ)は,示範の"スタイル"を潜伏変数にコード化し,政策が推論時に1モードにコミットすることを可能にします.各モードの十分な示範 (2050モード最低) が要求されます.
  • ミティゲーション 拡散政策: 拡散は,各モードから平均ではなく,任意のモードから否定することを学ぶことで,自然に多モード分布を処理します.
  • ミティゲーション データキュレーション: 戦略が強く好まれる場合 (例えば,部署環境では常に左からアプローチする) 訓練セットをキュレーションしてその戦略を過度に表現する. 50/50ではなく70/30のミックスにより,政策が好ましいモードに偏見する.

障害モード4 接触の近くでの精度低下

症状: 接近と粗い位置付けの際に動作が良好だが接触の時に一貫して失敗する 挿入作業で25mmに失敗する,移転中に物体を落としたり,座席接続に失敗する.

  • ** 根本原因:** カメラベースの認識は,限られた解像度を有する. 作業場から固定カメラの典型的な距離6080cmでは,1カメラピクセルは,作業場位置の約0.51mmに対応する.
  • ** 縮小 手首カメラ:** 手首を搭載したカメラ (接触点から515cm) は,批判的精度段階では1020×高効果的解析度を提供します.詳細な分析については[カメラ配置記事]T2を参照してください.
  • **減速 力/トーク反射:**手首に搭載されたF/Tセンサー (ATI Mini45,OnRobot HEX) を追加することで,カメラ解像度に依存しない接触検出が可能.最終接触段階のために力信号を使用するためのポリシーを訓練できます.
  • ** 緩和 2段階の政策:** 作業を粗大な位置付け段階 (カメラベースの標準解像度) と精度接触段階 (腕カメラまたはF/Tフィードバック) に分割する. 異なる政策を訓練するか,接触の近くで精度政策に切り替える階層的なアプローチを使用する.

障害モード5: 遮断処理

症状: 作業場が遮断されていない場合,動作がうまく行っているが,ロボット腕やグリッパーがカメラと対象物の間に立つとき,動作がうまく行かない.

  • **根源原因:**固定カメラはロボット腕を通過して見ることができない.ロボットが物体に近づくとき,その腕は固定カメラの視野を遮ります.同じ遮断条件下でトレーニングデータは収集されていない場合,ポリシーは正確に正確な視覚フィードバックを必要とするときに配布終了した画像を受け取ります.
  • ** 縮小 手首カメラ:** 手首を搭載したカメラは,腕の配置に関係なく,グリッパーとオブジェクトのインターフェースを一貫して眺める.手首カメラの腕による遮断は物理的に不可能である.
  • Mitigation 多視野設定: 別の角度で2番目の固定カメラを追加すると (例えば,上頭 +側) 少なくとも1台のカメラが腕の遮蔽時にでも常に作業場をはっきりと眺めるようにします.
  • ミティゲーション 一貫した収集条件: 展開で遮蔽が避けられない場合,同じ遮蔽配置で腕で訓練データを収集することを確認してください.遮蔽が発生しない異なる形状のテーブルで訓練データを収集することは,展開を代表する視覚入力に関する政策を訓練します.

障害モード評価プロトコル

ポリシーを導入する前に,この体系的な評価プロトコルを実行してください.

  • 名前の条件: 30回の試験で訓練実験室での試験.
  • 照明の変動: 3つの異なる照明条件でそれぞれ10回の試験 (上空の光,温かい環境,薄暗い).
  • 高度と位置の変動: 2つのテーブルの高さ (訓練高度から±10cm) で10回の試験.
  • ディストリੈਕਟਰオブジェクト: 35の無関係なオブジェクトを作業場での10回の試験.
  • 新作物変数: 対象物と異なる色や質感の変数による10回の試験.
  • デプロイ環境: 打ち上げ前に実際のデプロイ環境で20回の試験.

システム的な政策評価

RCSVプラットフォームには,実在部署前にシミュレーションで自動的に失敗モードプロトコルに対するポリシーを実行する構造化評価フレームワークが含まれます.

プラットフォームを探索 →