Blogに戻る

ロボット学習の拡散政策:それが何であり,どのように使用するか

ロボットにとって拡散政策とは何か? 拡散モデルが行動クローンに優れている方法,どのようなデータが必要なのか,どのように訓練するか,RCSVデータサービスが拡散政策プロジェクトを支援する方法について学びましょう.

部分: [模倣学習ガイド]

拡散政策は 2023年に Chi et al.によって導入され,ロボット制御に生成モデル革命をもたらした.アクション生成を否定的な問題として扱うことで,より単純な行動クローンアルゴリズムができない方法で操作行動の多型的で高次元性に対処する.

拡散 政策 は 何 です か

拡散政策は,分散確率モデル (DDPM) を否定する基礎にあるロボット制御政策の一クラスである. 安定した拡散のようなテキストから画像モデルに基礎を置く同じ数学的な枠組みである. ロボット文脈では,生成される"画像"はロボット行動の連続である (軌跡). 動作空間における純粋なガウスノイズから始まり,モデルは,現在の視覚観測とロボット状態に条件付けられ,10100の動作を表示した後,一貫した高品質のアクションシーケンスを生成します.

重要な洞察は,分散型モデルは,単一の最良の行動を予測するよりも,行動に対する完全な確率分布を学ぶことです.ロボット工学にとって,これは重要です.同じ作業の人間の示範は,自然に多型です.人物は微妙な文脈の兆候によって,左側または右側からカップを握ることができます. この分布を単一の予測に崩壊させるモデルでは,いずれか1モードにコミットして,他の半分に失敗するか,またはモードを平均して,常に失敗する奇妙な中間軌道を生成します.拡散政策は,分布を明示的にモデル化し,推測時にサンプルを採取することによってこれを回避します.

配分理論: 拡散モデルが行動を学ぶ方法

拡散政策の数学的な基礎は,データ分布のログ確率密度の梯度を学習するスコアマッチングです.進捗過程で,ガウスノイズは,変数スケジュールに従って,T時間段で示示データセットから動作軌道を徐々に追加します.Tステップでは,騒音軌跡は約標準的なガウスノイズです. ニューラルネットワークはこのプロセスを逆転させる訓練を受けています:騒音な行動軌跡と現在の観測により,追加された騒音を予測します (または相当すると",スコア" ログ密度の梯度).

訓練の目的は,誤りによる平均平方損失である. 予測された騒音と進捗過程で追加された実際の騒音の間には,誤りによる平均平方損失がある. 公式には,観測による騒音予測ネットワーク epsilon_theta の場合:

L = E[

a_0 はクリーンアクション軌跡である場合,epsilon はガウスノイズサンプル,alpha_t はタイムステップ t でノイズスケジュールパラメータであり,すべてのトレーニング例,ノイズサンプル,タイムステップに期待されます.この目標は,各タイムステップでノイズ分布のスコアを匹配する同等です.

ロボットにとってこの作業を可能にするのは,条件付けメカニズムである. CNNやViTエンコーダーからの画像の特徴を観察し,プロピオセプティブ状態を伴うものにより,現在のシーンに適した行動軌道を否定する. 同じデノイズネットワークは異なる観測の軌道を根本的に異なるものとする可能性があります なぜなら観察機能が学習された行動分布の異なる領域を通ってデノイズプロセスを指导しているからです

U-Net vs トランスフォーマーアーキテクチャ

拡散政策論文 (Chi et al., 2023) は,デノイジングネットワークの2つのバックボーンアーキテクチャを評価した.プロジェクトに適切な変 variantを選択するには,妥協点を理解することが不可欠です.

CNN U-Net バックボーン (放送政策C)

U-Netのバックボンはアクションシーケンスを1D信号として処理し,スキップ接続を持つコンボルショナルアーキテクチャを適用します. 画像拡散モデルで使用されている構造は,空間ではなく時間的な次元で動作します.観測機能は,各 U-NetブロックにFiLM (Feature-wise Linear Modulation) 条件を注入します.

  • 標準設定では,パラメータ: ~25M
  • 訓練時間: RTX 3090で4~8時間200話
  • インフェレンスは (DDPM,100ステップ): ~900ms/アクション・パーツ
  • インフェレンスの (DDIM,10ステップ): ~15ms/アクション・パーツ
  • 強度: 速度の推論,GPUメモリが低い,単作業政策に適している
  • 弱点: 多タスクまたは言語条件設定の限られた容量

トランスフォーマーバックbone (分散政策-T)

トランスフォーマーの背骨は,それぞれのアクションタイムステップをトークンとして扱っており,観測トークンと拡散タイムステップの埋め込みをシーケンスに追加します.全シーケンスの自注意は,アクション依存性の時間モデル化をより豊かに可能にします.

  • パラメータ: 60100M 構成に応じて
  • 訓練時間: RTX 3090で8~16時間200話
  • インフェレンスの (DDPM,100ステップ): ~2.5s/アクションパーツ
  • インフェレンスの (DDIM,10ステップ): ~45ms/アクション・パーツ
  • **強み:**より高い容量,より優れた多タスクスケーリング,相互注意による自然言語のコンディショニング
  • 弱点: 遅い推論,高GPUメモリ (16GB+VRAMが必要),調節が難しく

実用的な推奨: 推論速度が重要である1つのタスクポリシーではU-Netのバックボーンを使用する (10Hz+でのリアルタイム制御). 多タスクポリシー,言語設定,または500以上のデモがあり,より大きなモデルから恩恵を受けられる場合のトランスフォーマーバックボーンを使用する.U-Netのバリエーションは80%のプロジェクトにとって正しい出発点です.

発泡時間:DDPM対DDIM対一貫性蒸留

拡散政策の推論時間コストは,その主要な実用的な制限である. 消極プロセスはネットワークを通過する複数の進路を必要とし,それぞれがわずかに低音な行動軌道を生成する.ステップの数は推論遅延と行動品質の両方を直接決定する.

Scheduler Steps レイテンシ (U-Net, RTX 3090) Quality vs DDPM-100 Notes
DDPM 100 ~900ms Baseline (100%) Too slow for most real-time control
DDIM 25 ~40ms 98-99% Good default for deployment
DDIM 10 ~15ms 95-98% Recommended for 10Hz+ control
Consistency Distillation 1-3 ~3-5ms 90-95% Best for high-frequency control, requires additional training

アクション・チャンキングメカニズムは遅延問題を緩和します: ディフュージョン・ポリシーは,単一のデノイズパスで16〜32の将来のアクションを予測します.ロボットは,次の部分が計算される間に,制御周波数 (例えば,10Hz) で,その部分から最初の8つのアクションを実行します. この重複な実行は,現在の部分が終了する前に,解消が完了する限り,解消時間ではなく,部分実行時間によって有効制御速度は制限されることを意味します.

なぜ 拡散 政策 は 標準 的 な 行動 クローン を 優れている か

標準行動クローン (BC) は,監視された後退問題として政策を訓練します.観察によって,行動を予測する.観察から行動へのマッピングが決定的であり,単模的である場合です.実践では,操作作業はめったにありません.テーブルからブロックを拾うような"単純な"作業でさえ,複数の有効なアプローチ角度,把握ポーズ,およびプリ-グリップ構成を含む. ナイフBCは意思決定点において躊躇する政策を策定し, 運動選択を妥協させたり, テストの分布がトレーニングとわずかに異なるときに完全に失敗する.

拡散政策は,ベンチマーク操作の套路におけるBC基線を一貫して上回っています.オリジナルの論文では,Robomimicベンチマークの12の11つの課題で最新の結果を達成し,高度なアクションマルチモダリティのある課題では特に大きな差が示されています. リアルロボット評価では,拡散政策はより強力な回復行動を示した. ロボットがわずかに誤った中間状態に達すると,決定的な道をたどるのではなく,広範な分布からサンプルを採取していたため,政策は回復することができた.

基準結果: ロボミミックと ロボスイート

Task (Robomimic) BC (MLP) BC-RNN ACT Diffusion Policy
Lift 78% 96% 98% 100%
Can 54% 82% 90% 96%
Square (bimanual) 18% 56% 72% 88%
Transport (long-horizon) 6% 24% 48% 62%

マルチモダルの作業 (スクエア,輸送) において,複数の有効な戦略が存在すると,幅が大きい.単モダルの作業 (リフト) において,すべてのベースラインが単一の正しい戦略を見つけることができるため,利点は小さい.

拡散政策とACTの選択を

ACT (トランスフォーマーによるアクション・チャンキング) と比べて,分散政策は,一般的に強い多様性のある課題でより良く,ACTのチャンキング予測が輝いている長期的依存性のある課題ではより悪く機能しています.

Choose Diffusion Policy When Choose ACT When
Multiple valid grasp strategies exist for each scene Task has a single dominant strategy
You have 300+ demonstrations and want to leverage data scale You have 50-150 demonstrations and need fast iteration
Recovery from perturbations is important Temporal consistency over long horizons matters more
Control rate of 10Hz is sufficient You need 50Hz+ control frequency
Single-arm manipulation with variable approach Bimanual coordination requiring tight temporal sync

実践的には,両方のアルゴリズムは,データセットの質と量が政策構造の選択よりも重要になるほど競争力がある.どちらを使うかわからない場合は,先は ACTを繰り返し速度のために試してみて,モード平均の失敗を観察した場合,ディフュージョンポリシーを試してみてください.

拡散政策に関するデータ要件

拡散政策は ACTよりも多くのデータから恩恵を受け,主にデノイズネットワークにはより多くのパラメータとより豊かなモデリング目標があるため. 制御条件下での単一の作業のための実践的な最小値は100~200回の示範です. 強力な展開性能を達成するために 対象位置の変化,照明の変化,時折のセンサー騒音の処理 作業ごとに300-500回のデモを予算する.ACTとは異なり,拡散政策は,かなり大きなデータセットサイズまで追加データで継続的に改善傾向があり,大規模なデータ収集に投資することを計画している場合はより良い選択です.

データの多様性は,音量と同じくらい重要です. デモは,展開で期待するオブジェクトの位置,方向,シーン構成の範囲を覆うべきです. 特定の場所にあるオブジェクトを常に集めた緊密なデモクラスターは,オブジェクトが数センチメートル移動すると失敗するポリシーを生むでしょう. RCSVの [管理されたデータ収集サービス]T1) は,構造化変異プロトコルに従います. 構造化可能なポリシーを生成するデータセットを確保するために,オブジェクトの位置,照明条件,オペレーターグリップスタイルを体系的にランダム化します.

観測表現も重要である.ResNet画像エンコードで端から端に訓練されたディフュージョンポリシーは,狭いタスク分布で凍結されたプリトレーニングエンコードを使用したポリシーを上回る,しかし,プリトレーニングエンコード (R3M, MVP, DINO) はテスト条件がトレーニングと異なる場合によりよい一般化をもたらします. 初期訓練を受けたエンコードで データの価値を最大限に発揮し 500以上のデモと安定した環境があれば 端から端までトレーニングに切り替える

訓練設定と計算要件

ディフュージョン・ポリシーの参照実装 (コロンビア・ロボティクス・ラボ GitHub で利用可能) は,UNetのバックドーン (より速い推論,より低い容量) またはトランスフォーマーのバックドーン (より遅い推論,より高い容量) を備えている.ほとんどの単作業プロジェクトでは,UNetのバリエーションが正しい出発点です. 単一のRTX 3090または4090でのトレーニングは,観測解像度と行動視界の長さに依存して200エピソードのデータセットでは4〜12時間かかります.

適切な設定のキーハイパーパラメータは:アクションの視界 (テーブルタスクで通常1632の予測可能な将来のステップ),拡散ステップ数 (100 DDPMで1025 DDIMで品質の損失が最小) と観測窓 (通常2つの過去フレームを含む場合) です. 政策のパフォーマンスを向上させる最も影響のある変化は,通常は,アーキテクチャのハイパーパラメータを調整するのではなく,データセットのサイズを増やすことです.

迅速な訓練開始命令

参照実装をクローンする git クローンする T15 cd diffusion_policy pip インストールする -e . # U-Net バリアントをデータセット (ZARR 形式) に列車する python train.py --config-dir=. --config-name=image_pusht_diffusion_policy_cnn \ task.dataset_path=/path/to/your/dataset.zarr \ training.num_epochs=3000 \ policy.noise_scheduler.num_train_timesteps= \politics.horizon=16 \ policy.n_obs_steps=2 #DDIMの推論を評価する.py_conalu=. --config-name=DD_fig_policy_disc_policy\\n\n\n\n\n_disc_policy\\n\n_disc_policy\n\n_disc_policy\n_policy\n_policy\n_policy\n_policy\n_policy\n_policy\n_policy\n_policy\n_policy\n_policy\n_po_po_po_po_s_s_s_s_s_s_s_s_s_s_s_s_s_s_s_s_s_s_s_s_s_s_s_s_s_s_s_s_s_s_s_s_s_s_s_s_s_s_s_s_s_s_

リアルロボットでの推論のために,100ステップでのDDPMは通常高周波制御には遅すぎます.RtX 3090 で10Hz制御に適した10Hz制御で ~20Hzで実行する10-25ステップのDDIMスケジュラルを使用します.代替的に,一貫性ポリシー蒸留は,より簡単な作業で最小限のパフォーマンス劣化で 1-3ステップ推論を達成することができます.

拡散政策のためにRCSVデータサービスを利用する

RCSVの [データサービスパイプライン] (T2) は,拡散政策参照実装とHuggingFace LeRobot フレームワークで直接使用のためにフォーマットされたデータセットを生成します.エピソードは,同期画像ストリーム,プロピオセプティブ状態,および50Hzでのアクションを伴うZARRアーカイブとして保存されます. 品質フィルタリングは,作業が成功に完了しなかった,ロボットが環境と衝突した,または操作者の躊躇によって非代表的な軌跡が生じたエピソードを取り除きます.

私たちの収集サービスは [RCSV遠隔操作プラットフォーム]T3) を用いて,双腕対応のリーダーフォローアワー制御,腕に搭載されたカメラとオーバーヘッドカメラ,オプションのフォース・トークログを搭載しています. 複数のタスクの拡散政策訓練では,タスクIDや言語による複数のタスクを学習する. 複数のタスクのバリエーションを同じキャンペーン内で収集し,統一データセットを提供できます.パイロットプログラムは200のデモで2,500ドルから開始し,500以上のデモのための完全なキャンペーンは8,000ドルから開始します.

OpenArm 1 ($4,500) または ALOHA ハードウェアプラットフォームで働くチームはネイティブハードウェアサポートを受けます. 要求に応じてカスタマイズされたハードウェア統合が利用可能です. データの収集に投資する前に 拡散政策を評価したいチームにとって,私たちの [公開データセット] (T6) には ZARR 形式で数百エピソードの操作データセットが含まれています. 訓練準備ができています.

関連 読書