ロボット の 模倣 に よっ て 習得 する 10 の 常識 の 間違い (そして その 解決 の 方法)
模倣学習によるロボット政策を訓練する際に最も一般的なエラーは,データ品質,アルゴリズム選択,評価,部署のエラーが各に対して特定の修正がある.
[模倣学習ガイド]
[←ブログ]
模倣学習の失敗は 数据の問題ではなく アルゴリズムの問題に由来します. ここでは,それぞれに特定の技術修正が付いている 10つのエラーが最もよく見られます.
紹介
模倣学習は,欺瞞的に接近できます.アルゴリズムはシンプルで,設定は標準で, [ACT] (
誤り 1: 作業の難しさには デモが少ない
最も一般的な誤りは,作業の複雑さに関係なく固定デモカウントを適用することです.チームでは,ACTが簡単なピックタスクで50回のデモで強力な結果を達成し,精度組み立て作業に200回のデモが十分になると仮定します.それはそうではありません.
粗略な難度スケール: L1 (大きな物体のオープンループのアクセスと取り付け): 50-200 デモ. L2 (さまざまな物体のポーズを持つ閉ループのピックスポット): 300-800 デモ. L3 (接触豊富な挿入, 5mm 耐容量のある組み立て): 1,000-5,000 デモ. L4 (濃い手操作): 5,000-20,000 デモ.
訓練損失を検出する方法: 訓練損失が収束するが,評価成功率は低い (<60%). 政策は一般的な動きパターンを学び,正確な接触豊富な段階では失敗する.
修正: 収集開始前に上記の難易度スケールを予算推定として使用します.推定コストが予算を超えると,課題を単純化 (より大きな寛容,前置物体) して難易度レベルを1つ低下させるかどうかを検討してください. RCSVの [データサービス]
誤り 2: 収集と配備の間の照明が一致しない
人間の目には 軽いものに見える 照明の変化は 窓から朝から午後まで 太陽を移動し 窓の上にある
検出方法: 収集環境ではポリシーがうまく動作しますが,展開では失敗します. 両環境からカメラフィードを視覚化します. どのチャンネルでもヒストグラムの差異は,照明問題を示します.
修正: データ収集中に照明を制御する (固定色温のブラックアウトカーテンまたはLEDパネル,5000Kの昼光バランス).トレーニング中に攻撃的な色振動増強を適用します:明るさ+/-30%,色素+/-20%,飽和性+/-15%. 導入準備を整える前に5つの異なる照明条件で訓練されたポリシーをテストします.
誤り 3 失敗したデモを フィルタリング しない
新しいオペレーターからの原始の示範データは通常15~30%の失敗エピソードを含みます.遠隔操作システムを学習しているオペレーターは,乱用なハプチャーをしたり,偶然にオブジェクトを解放したり,作業中途中に中止したりします.これらのことをトレーニングセットに組み込むと,ポリシーは成功と失敗の両方の行動を模倣することを学んでます.これは平均的な政策になります.
** 検知する方法:** 政策は,躊躇,部分的な把握,または2つの異なる戦略間の平均的な"混乱"な行動を示している.あなたのトレーニングセットをレビューしてください:エピソードの5%が明らかに失敗した場合,あなたはこの問題を持っています.
修正: 簡単な成功分類器を作成または使用する. 選択場所の作業では,エピソード終了時に対象ゾーンに物体がいるかどうかをチェックするほど簡単です. 訓練前に失敗したエピソードをフィルタします. RCSVでは,自動化された成功分類と,配信前に収集されたすべてのデータに対する人間のレビューを実行します. 10% の失敗したデモでさえ,ポリシー成功率の 20-30% の低下を引き起こす.
誤り 4 単一の カメラ を 使う
固定カメラは接近中に遮断問題を生み出す.ロボット腕が作業場へ移動すると,同時にオブジェクトとグリッパーの視点をブロックできる. 詳細が最も必要とされるときに,視覚情報がない状態で,ポリシーは残ります. これは,最後の5cmの接近が重要な挿入作業に特に有害です.
検出方法: 政策は,プレグラスプアプローチで成功するが,最終的な 2~5cm接触段階では失敗する. 障害ビデオの分析では,標的対象物が,重要な瞬間に腕に閉じ込められていることが示されている.
修正: ベースラインとして3台のカメラのセットアップを使用します. (1) 作業場概要のためのオーバーヘッド固定カメラ (2) 腕とオブジェクトの関係のためのサイド角度カメラ (3) 接触区のための腕に搭載されたカメラ.腕のカメラは最も影響を与える唯一の追加です. 詳細なカメラ設定については, [遠隔操作ガイド]
誤り5 誤った物体ポーズ ランダム化
多くのチームはほぼ同じスタートポジションにある物体によるデモを集めており,操作者は各エピソードの前に物体をほぼ同じ場所に配置します. これは,その正確な位置にある物体に対して動作するポリシーを訓練し,物体が5cmに移動すると失敗します.
**どのように検出するのですか? **トレーニング分布位置 (>90%) に高い成功率が高く,小さな位置の乱れでも迅速な劣化があります.すべてのトレーニングエピソードの開始位置 (x,y) を図に描く - 集中的に集結した場合,ランダム化不足です.
修正: 各エピソード前に,アクセス可能な作業場内のランダムな位置に対象オブジェクトを置く. 格列またはマークされたゾーンを使用して,体系的なカバーを確保する.少なくとも,訓練セットは,オブジェクトが部署時に現れる作業場面積の80%をカバーする必要があります. 方向性感のある作業 (挿入,組み立て) にも,ランダム化方向性:少なくとも8つの異なるスタート方向が均等に分布されます.
誤り6 連絡先の豊富な相データ欠落
多くの作業には,アプローチ,接触,操作,解放という異なる段階があります.操作者はしばしば接触段階 (グリッパーが物体を触る瞬間) を急ぐので,それが彼らにとって直感的な感じです.しかし,これはまさに政策が最もデータを必要とする段階です. 接触段階を2〜3つの時間段階で示威が進むと, 政策は任務の最も重要な瞬間について訓練信号がほとんどありません.
検出方法: ポリシーは正しいアプローチを実行します (正しい位置に移動します) しかし接触時に失敗します - 握手は不安定で,挿入が失われます,配置はオフです. デモンストレーションのタイミングを検証してください:接触段階 (最初の触から安定した握手まで) が <5時間ステップで50Hz にあります.
固定: 接触段階では操作者に速度を遅らせるように指示する.有用なプロトコル:正常な速度で接近し,グリッパーが物体から3cm以内にあるとき50%の速度まで遅い速度で接近し,安定した握手を達成するまで接触を通って速度を遅い速度で保持する.これは,政策に重要な段階の訓練信号を3~5倍増やす. 代替的に,接触段階の直前に開始する追加の示範を収集する (グリッパーが既に物体の近くに置かれている).
誤り7 訓練の配分のみで評価する
訓練を受けた特定のオブジェクトインスタンスの 90% の成功率を達成した政策は,少し異なる条件で 30% を達成することができる.訓練配分のみを評価すると,展開パフォーマンスを予測しない楽観的な数字が得られる.
** 検出方法:** 訓練条件での評価が未成ければ,定義的にはこの問題がある. 訓練条件でのみ報告された成功率は信頼性がない.
修正: ポリシーを最終的なものにする前に,同じカテゴリーの新型オブジェクトインスタンスを (1) (異なる色,サイズ,質感), (2) 訓練配分の外の新型スタートポジション, (3) 異なる背景/テーブル表面を (3) 実行してください. ポリシーを要求して,すべての3つの条件であなたの成功目標を達成します. 条件ごとに30〜50回の評価エピソードのための予算.
誤り 8 番: 複合誤り を 無視 する
行動クローン政策は,誤差が増えるため,小さな誤差が時間とともに蓄積し,訓練中に見られなかった状態にロボットを押し込む.この政策には,これらの新しい状態から回復するデータがありません.したがって,さらに新しい状態へと導く別の悪い決定を下します. 5〜10秒以上の作業では,初期段階が正しいように見える場合でも,完全な失敗を引き起こす可能性があります.
検出方法: 政策は,一度に開始され,時間の経過とともに悪化する.最初の23秒は良好に見えます.58秒までにロボットは回復できない状態にあります.長編は短編よりも高い速さで失敗します.
修正: 2つの具体的なアプローチ. アクション・チャックリング (ACT]
誤り9 誤った行動空間選択
行動空間 - 実際の政策が予測するものは - 業績に驚くほど大きな影響を与える.共通する2つの選択肢は,共同空間行動 (目標共同位置) とカーテジアン空間行動 (目標最終効果ポーズ) です.あなたの任務の間違った選択は,政策に不必要な困難をもたらす.
検出方法: 政策は良好な訓練 (低損失) をしますが,部署時に揺れ動いたり物理的に不可信な動きを生む. 共同空間政策は自己衝突する構成を生む可能性があります. カートジアン空間政策は,動力的に達成できない目標を生む可能性があります.
修正: リーダー・フォローワー・テレオペレーションデータのデフォルトとして,共同空間アクション (ターゲット・共同位置) を使用する.リーダー・アームは自然に共同空間目標を生成する.あなたのタスクが強力な幾何構造を有し,カーテジアン座標で表現するのが容易である場合のみ,カーテジアン空間アクションを使用する. ACTについては,元の実装では共同空間アクションを使用しており,これは推奨されているデフォルトです.
# Joint-space vs Cartesian-space action -- use joint-space by default
# This is how RCSV records actions for ACT training:
# GOOD: Joint-space action (7-dim: 6 joints + gripper)
action = leader_arm.get_joint_positions() # Direct from leader arm
# Stored as: [j1, j2, j3, j4, j5, j6, gripper_width]
# AVOID (unless you have a specific reason):
# Cartesian-space action (7-dim: xyz + quaternion)
# action = robot.get_ee_pose() # Requires IK at deployment
# IK solutions may be non-unique, introducing discontinuities
誤り10: データフライホイールを飛ばす
優れたポリシーを持つチームは 先ほどデータを多く収集したわけではありませんが 観測された失敗モードに基づいてデータを継続的に改善したチームです 一回の収集と一次訓練により 最初のデータセットの質に冷凍されたポリシーが生まれます
検出方法: ポリシーを訓練した,それはX%の成功率で動作し,それ以来追加データ収集していない. Xは新しいデータなしでは改善しない.
修正: データのフライホイールを最初の日から構築する.ポリシーを展開し,すべての失敗を記録し,毎週失敗をレビューし,トップ3の失敗モードカテゴリーを特定し,それらの失敗モードをカバーする50〜100の標的型デモを収集し,再訓練する.連復ごとに50〜100の標的型失敗回復デモでさえ,強度を劇的に向上させることができます. RCSV データプラットフォーム はこのループを効率化します:故障ログは直接収集タスクキューにフィードされ,オペレーターは特定の故障カテゴリに対して標的型デモを収集します.
データセット品質チェックリスト
訓練の前に,データセットがこれらのチェックをすべて合格することを確認してください.
- [ ] 事件数値は困難の限界を満たしている -- L1: 50+, L2: 300+, L3: 1000+, L4: 5000+
- **[ ] フィルタリング後,トレーニングセットで失敗率の5%
- [ ] オブジェクトはランダム化 - 開始位置は部署作業スペースの80%以上をカバーする
- [ ] 照明制御または拡張 - 収集中に一貫した照明 OR aggressive augmentation planned
- [ ] マルチカメラ設定 - 最低2台のカメラ (上頭+腕)
- [ ]タイムスタンプは単調で同期化される - 10ms以内での観察行動の調整
- [ ] 接触段階のサンプルを適切に採取した -- >5 段階から安定した握りまで
- [ ] 操作者は発見した遺跡は見つかりませんでした - 躊躇,修正,または異常なパターンのために10つのランダムエピソードをレビューします
- [ ] 軌道の平らさ 限界内 - 作業特有の限界を下回る平均の転移
- **[ ] 試験に備えた新しい条件を備えた30〜50話の予備評価セット
RCSVのデータ収集パイプラインは,これらのチェックのほとんどを自動的に実行します.自社データを収集するチームでは,このチェックリストは,すべてのトレーニングランニング前にレビューされるべきです.このチェックリストで使用される技術用語の定義については,私たちの [語彙]
関連 読書
- ACTポリシー説明 --最も人気のあるILアルゴリズムのアーキテクチャ詳細
- [テレオペレーションを開始する] (T10
) - 収集を正しく設定する方法 - [クロスボディメントトレーニング] (T11
) -- 多ロボットデータを利用する - RCSVデータサービス -- 品質フィルタ化された示範収集
- RCSVデータプラットフォーム --データセット管理と品質追跡
アルゴリズムを修正する前に データパイプラインを修正する
RCSVのデータ収集サービスは,自動化された成功分類と標準的に執行される完全な品質チェックリストを備えた,品質をフィルタリングした,多カメラの示範を提供します.
[データサービスを探求] [T14







