Learnに戻る

ロボット の 模倣 学習: 行動 クローン から 拡散 政策

模倣学習の明確な導入 行動クローン,分布シフト,DAgger,アクション・チャンキング,拡散政策について説明しました

[←学び]

人々の示範からロボットが 技能を習得する方法を学び 素朴な模倣が失敗する理由や 現代のアルゴリズムは 核心課題を克服する方法を学びましょう

模倣 学問 は 何 です か

模倣学習 (IL) は,ロボットに専門家示範から学習して行動することを教えるアルゴリズムの一族である.公式には,示範のデータセット (T0) があります.このデータセットでは,T1は,専門家が実行した行動である.

ILの魅力は実用的です. 報酬関数を手工的に設計したり,運動原始的な記述をするよりも,ロボットに何をすべきかを示すのは人間にとってはるかに簡単です.

行動 クローン: 基礎基準

行動クローン (BC) は最も単純な ILアルゴリズムです.この問題は監督学習として扱われます. 状態のT5を考慮して,行動のT6を予測します. 予測された行動と専門家行動の間の平均平方誤りを最小限に抑えることでニューラルネットワークを訓練します.

BCは訓練に迅速で,実装に容易で,短時間作業に驚くほどうまく機能します.標準BCパイプラインは午後で実行できます. 50回のデモを収集し,100つの時代間にわたってResNet+MLPを訓練し,展開します.

テストの時に,小さな予測エラーでさえも,ロボットは見たことのない状態に移動します. テストの時に,ロボットが見たことのない状態に移動します. 次の予測は正確ではなく 誤差が増加し 数秒以内にロボットは完全に分散状態で 回復できません

配分 変化 問題

配分シフトは模倣学習における主要な課題である.訓練配分 T7 (示例中に見られる状態) とテスト配分 T8 (学問された政策によって訪問される状態) は異なる.BCは訓練配分におけるエラーを最小限に抑えるため,テスト配分における行動について保証は与えません.

計算の洞察: T10の平面にステップごとにエラー T9が含まれるポリシーでは,予想される誤差総数は T11として増加します.タスク長さを倍増すると複合誤差を4倍にする.それゆえBCは5秒のタスクで動作しますが,特殊処理なしで30秒のタスクでは失敗します.

配分シフトを固定する

データの集計 (DAgger) は,分布シフトを繰り返し処理します.

  • ステップ1: 初期デモについて初期BC方針を練る.
  • ステップ2: 実態環境で学習された政策を導入します.
  • 政策訪問の各州に 誤った結果に 悪い州まで 適切な行動をとるように 専門家を依頼する
  • ステップ4: この (状態,修正されたアクション) ペアをデータセットに追加する.
  • ステップ5: 総集計データセットのポリシーを再訓練する.ステップ2から繰り返す.

訓練の配分は,いくつかのラウンド後に,実際に政策が訪問する州と密接に一致し,複合誤差が劇的に減少します.DAggerは理論的には健全だが高価です.ロボット実行中に人間の専門家が現役で,リアルタイムで行動を監視し,修正する必要があります.

現代アルゴリズム:ACT,拡散政策,IBC

ロボット模倣学習の最新技術を3つのアルゴリズムが支配しています

  • ACT Transformers の アクション チェンキング: ACT は,各ステップで単一のアクションを予測する代わりに,将来的なアクションの chunk of T12 を同時に予測する (通常は 50Hz で K=100,つまり動きの2秒).ロボットがその部分を実行し,再計画します.これは複合エラーサイクルを壊します. ACTは多モダルの示範データを処理するためにCVAEエンコードとアクションシーケンスを生成するためにトランスフォーマーデコードを使用します.
  • 拡散政策: 行動分布を伝播プロセスを表すモデル.単一の行動を予測する代わりに,拡散政策は,ランダムなノイズを可視な行動軌道を繰り返して表すことを学びます.これは,自然に,ある状態に複数の有効なアクションが存在する場合 (例えば,左から右に握る) を処理します. 単一のBCネットワークはこれらのソリューションを平均して無効なものを予測する. 拡散政策は両方のモードを表現することができます.
  • IBC 暗黙の行動クローン: 直接行動予測器ではなくエネルギー関数 T13を訓練する.インフェレンスは梯度下降またはMCMCサンプルによるエネルギーを最小限に抑えるアクションを見つけます.多モード分布に堅固ですが,推論時に計算的に高価です.

アルゴリズム比較

Algorithm Handles Multi-Modal Action Horizon Training Speed Inference Speed Best For
Behavior Cloning No (averages modes) Single step Very fast Very fast Short tasks, simple grasps
DAgger No Single step Fast per iter Very fast Tasks where expert can correct live
ACT Partial (CVAE) Chunk (K steps) Fast Fast Bimanual, contact-rich tasks
Diffusion Policy Yes Horizon (T steps) Slow Moderate Complex, multi-modal tasks
IBC Yes Single step Moderate Slow Research; multi-modal with energy landscape

スタートアップの専門家には,データパイプラインとハードウェア設定を検証するために BC を始めましょう.より長い視野や接触に富んだ課題に取り組む必要があったら,ACT またはディフュージョンポリシーに移動します.ACT とディフュージョンポリシーの選択は,原料性能よりも,あなたの作業構造に依存します.