Blogに戻る

ロボット学習の拡散政策:どのように機能するか,いつ使うか (2026)

ロボット操作の拡散政策: 否定が行動を予測する方法,CNNとトランスフォーマー,そしてACTと行動クローンに勝ったとき. 2026年ガイド

拡散ポリシーは接触豊富な巧妙なロボット操作作業のための主要な模倣学習アルゴリズムです. 標準的行動クローン を一貫して上回り,マルチモダルの示範の作業ではACT をしばしば上回ります.このガイドでは,どのように機能するか,ACTとBCとどのように比較するか,どの超パラメータが最も重要であり,RCSVでどのハードウェアと結合するか説明します.

拡散 政策 は 何 です か

2023年にコロンビア大学で Chi et al. が導入した拡散政策は,画像生成拡散モデル (DDPM, DDIM) からロボットアクション予測にスコアマッチングフレームワークを適用する.観察から単一の次のアクションまたは短いアクションシーケンスを予測する代わりに,政策はランダムなアクション軌道を一貫した高品質な動き計画に繰り返し代入することを学します. その結果は,実践的には,従来の行動クローンよりも,人間の示範データの多型性に対処するのに,かなり良い行動政策です.

基本的な洞察は単純です:人間操作員からロボットデモを収集する際には,異なる操作者が同じ作業を質的に異なる方法で実行します. 対象に左側または右側から近づく,引き出す前に押す,または上側から側に向かって握る. これらはすべて有効で,作業を完了する行動です. 平均二乗エラーで訓練された標準行動クローンモデルでは,これらのモードを平均して,2つの有効な行動の間にあるアクションを生成します.これは通常無効です.拡散政策は,観察されたアクションの完全な条件分布をモデル化するため,各モードから独立した表現とサンプルを生成することができます.

本論文では12つのシミュレーションされたロボット操作作業とリアルロボット操作作業に関する拡散政策を示し,そのうち11件で最新の成果を上げました.リアルロボット作業にはT形ブロックを押すこと,トーティッラに双手式の散布ソース,および1mmの配置容量を持つ精密なツールピック作業が含まれていました.

拡散 政策 の 働き

拡散政策の訓練と推論は,画像ではなくアクションシーケンスのために適応された標準的なDDPMデノイジングフレームワークに従います.

訓練

訓練中に, 騒音スケジュールに従って _T_時間段 (通常 T=100) にわたってガウスの騒音を追加することによって,クリーンアクション軌跡 T0 (示範データセットからサンプル) が徐々に腐敗します. 神経ネットワークは1Dタイムロマン CNNまたはトランスフォーマーによって訓練され,騒音のアクション,デノイズステップインデックス,および現在のロボット観測 (画像 + proprioception) を考慮して,各ステップで追加されたノイズを予測する.これは標準スコアマッチング目標です. ネットワークは,予測されたノイズから (ノイズアクション,タイムステップ,観測) →予測されたノイズからマッピングを学ぶ.

推論

推論時に,モデルはアクションシーケンスと同じ次元性の純粋なノイズベクトルからスタートします.その後,現在の観測によって導かれ,ノイズコンポーネントを予測するために神経ネットワークに呼びかける各ステップで _K_を指すステップ (通常DDIMではK=10 ,DDPMではK=100) を実行します. Kステップの後,結果は完全なアクションシーケンス (通常は10Hzで1632ステップ先,または50100ステップ50Hz) で,現在の状態の合理的でスムーズな継続を表します.

観測条件は主要な建築選択である.拡散ポリシーでは,2つのエンコードオプションがサポートされています.

  • CNNベースの (DP-C): ResNet-18または ResNet-34 のバックボンは画像観測を特徴ベクトルにコード化し,その後プロピオセプティブ状態と融合し,デノイジングCNNを条件にするために使用します.訓練と推論を速くします.シングルカメラ設定に最適です.
  • トランスフォーマーベースの (DP-T): ViT型トランスフォーマーが画像トークンをコードし,プロピオセプショントークンと融合する.多カメラセットアップで表現が速い.遅い推論 (120ms vs 40ms RTX 3090).

視野制御を終了する

重要な実装詳細:拡散政策は,後退する地平線アプローチを使用します.政策は,長さ Tp (例えば16ステップ) のアクションシーケンスを予測しますが,再計画前に最初の _Ta_ステップ (例えば8ステップ) を実行します.これは時間一貫性 (長時間 Tp =滑らかな動き) と反応性 (短い Ta =予期しない変化に対する迅速な反応) の間のバランスを生み出します. 標準標準のPp/Ta=2の比率は,ほとんどの操作作業でうまく機能します.

拡散政策とACT:実用的な比較

Property Diffusion Policy ACT (Action Chunking Transformers)
Multimodal action distributions Excellent — models full distribution Good — CVAE captures variance but can mode-average
Inference latency (RTX 3090) 40–120ms (DDIM K=10 to K=100) ~10ms (single forward pass)
Training time (50 demos, RTX 3090) 4–8 hours (CNN), 8–16 hours (Transformer) 2–4 hours
Temporal consistency High — denoising produces smooth trajectories High — action chunking provides consistency
Bimanual coordination Good with transformer variant Excellent — natively designed for ALOHA bimanual
Dexterous hand control (20+ DOF) Excellent — handles high-dim action spaces well Moderate — chunk size tuning needed for high DOF
Open-source reference implementation Yes — diffusion_policy repo (Columbia) Yes — act repo (Stanford)
LeRobot integration Yes — native support Yes — native support

タイトル比較:ACTは推論で速く,訓練が容易で,時間的に重要なシステムや計算能力が限られているチームにとってよりよい.拡散政策は多型示範を自然に処理し,手腕のような高次元アクションスペースにより良くスケールします. 実践的には,50200のクリーンデモによるテーブルタスク操作のほとんどは,性能が比較可能である.デモが自然に多様である場合やアクションスペースが14DOFを超えると,拡散ポリシーを選択してください.ACTの特定調節をより深く調べるために,私たちの [ACT政策ガイド] (T10) を参照してください.

拡散政策と標準行動クローン

標準行動クローン (BC) は予測された行動と実証された行動間のMSEを最小限に抑える.この方法は,示例データセットが単模型のとき,すべてのオペレーターが同じ方法で作業を行うとき,動作します.問題は,人間の示例はほとんど決してないことです. BC ポリシーが,次の2つの異なる行動によるデモで出現した観察を観察すると,それを平均し,両例で誤った動きを生成します.これをモード平均の問題と呼びます.

拡散政策は,条件付き平均 E (アクション) ではなく,全体的な条件付き分布をモデル化しているため,モード平均を回避します. 同じ曖昧な観察を考慮すると,拡散政策は,いずれかのモードから一貫してサンプルを採取します. そのため,元の論文では,最も高い示範差が示された課題に対して BCと比較して最大の改善を示した. 推進作業 (オペレータはブロックを異なる角度から押し) と双手散布作業 (オペレータは異なる調整戦略を使用した).

作業の差が示された軌道の5%未満である場合 (つまり,すべての操作者はまったく同じことを行う) 実践的には,良い脊椎を持つBCは拡散政策に一致する.あなたの作業は自然差がと実際の作業の大半がの差がである場合,追加のトレーニング時間は価値がある.

拡散 政策 を 選ぶ 時

拡散ポリシーを選択する

  • あなたのデモは多型です. 異なるオペレーターが,意味のある異なる動き戦略を通じて作業を完了した場合,拡散政策はACTまたはBCよりもうまく処理します.
  • あなたはDOFの高いアクションスペースを持っています. Dexterous hands (1620+DOF) は,ACTの固定部品ベースのアプローチよりも,全アクション次元における関節関係をモデル化する拡散政策の能力によりより恩恵を受けています.
  • 精密なエンドポイント定位が必要である. 原稿は,デノイジング中に繰り返す精錬による精密な挿入作業で2mm以下の配置精度を達成する拡散方針を示した.
  • あなたは公表された結果に対してベンチマークを行っている. 最近の論文 (2024~2026) の多くでは,拡散政策が基線として報告されています.
  • **訓練のためのGPU予算が多くなります.**複数のGPUがあれば,拡散政策のトレーニングはうまく並行し,トランスフォーマー変数はより計算によりより良い結果が得られます.

ACT を選択する

  • インフェレンスの遅延は極めて重要です. 1 つのインフェレンスのステップで10ms で,ACT は適度にハードウェアで100Hz で実行できます. 40120ms での拡散ポリシーはK=10100 で825Hz で終了します.
  • ALOHA形式の双手データで作業しています. ACTはALOHAのために設計され,参照実装にはフォーマット変換は必要ありません.
  • 訓練計算は限られています. 2時間 ACTトレーニングは,作業設計を迅速に繰り返している場合,拡散政策の問題では48時間です.
  • あなたは特定の先の結果に一致しています. もしスタンフォードの ACT数を正確に複製する必要があるなら,ACTを使用してください.

拡散政策の主要なハイパーパラメータ

針を実際に移動させるパラメーターは,

Parameter Default Effect of Increasing
pred_horizon (Tp) 16 Smoother trajectories; slower re-planning; more memory
action_horizon (Ta) 8 Fewer inference calls; less reactive to perturbations
obs_horizon 2 More temporal context; helps with tasks requiring memory of recent motion
num_diffusion_iters (K) 10 (DDIM), 100 (DDPM) Higher quality actions; slower inference
noise_scheduler DDIM DDPM is higher quality but 10x slower; DDIM preferred for real-time use
vision_encoder ResNet-18 ResNet-34 / ViT improves performance; requires more compute
n_obs_steps 2 Stacking more observation frames helps tasks with motion-based cues (sliding, rotating)

T8を長すぎ,T9を短すぎに設定する最も一般的な誤り.これは計画された軌道を過度に実行し,接触イベントに反応しないポリシーを生成します.巧妙な操作のために,推奨される出発点は Tp=16, Ta=8 です.その後,あなたが観察しているタスク失敗モードに基づいて調整します.

放送政策 (コロンビア参照実装) git clone T24 cd diffusion_policy conda env をインストールして -f conda_environment.yaml conda を起動する robodiff # Push-T データセットのCNN変数をインストールする python train.py --config-name=train_diffusion_unet_lowdim_push_t_work space # 自身のデータセット (Le train.t_work space) にトレーニングする python.py --config-name=train_diffusion\unet_hybrid_work space \ task.dataset\path=/to/your/lerobot_dat_task._action=16_horizon \._horizon \._horizon \._task_task_task_task_task_task_task_task_task_task_task_task_task_task_task_task_task_task_task_task_task____________________________________________________________________________________________________________________________

拡散政策にうまく対応するデータセット

拡散政策は,以下の特徴を持つデータセットで最もよく表れています:

  • スムーズで連続した軌跡: 消化プロセスがスムーズな出力を生み出すため,揺れ動いたり不連続した動きによる示例は,モデルの誘導偏見と訓練データとの間に不一致を作り出す.
  • **エンドエフェクター状態の一貫した記録:**標準のCNN変数における拡散ポリシーでは,関節角ではなく,エンドエフェクター位置+指向+グリッパーを動作として使用します.データセットが関節角を記録する場合は,前向きの кинеマティック層が必要になります.
  • **利用可能な場合,複数のビュー:**トランスフォーマー変数 (DP-T) は,23カメラビューをトークンとして使用できます.マルチビュー設定は,遮断または深度曖昧さのある作業でシングルビューを一貫して上回ります.

拡散政策に適合する公開基準データセット

Dataset Tasks Notes
Push-T (Columbia) T-block pushing Reference benchmark; highly multimodal; download from diffusion_policy repo
RoboMimic Can, Lift, Square, Transport Standard benchmark; MH (multi-human) subset tests multimodal handling best
ALOHA / ACT datasets Bimanual tabletop tasks Requires joint-space conversion; diffusion policy-T performs comparably to ACT
DROID (Google) 76,000 diverse robot episodes Large-scale; good for fine-tuning pretrained diffusion models
RCSV custom datasets Varies by project Delivered in LeRobot format; compatible with diffusion_policy repo out of the box

拡散政策に関するRCSVハードウェア勧告

精一杯の任務: ウジの手

指のレベルの技巧を要求する作業では,手操作,握 adjustment,オブジェクトのリオーリентаーションでは,RCSVの拡散政策のための最も強力なプラットフォームである.RCSVの20のアクティブDOFと指先の768点触覚センサーにより,拡散政策のトランスフォーマー変数が完全に利用できる豊富なアクションスペースと豊富な観測空間の両方を提供します. 内部基準では,Wuji Handの拡散ポリシー-Tは接触型指相互作用の課題で ACTを1825パーセントポイント上回っています.

768点のタクチルマリーは,手当たり768次元観測ベクトルを生成し,DP-Tトランスフォーマーのために平ら化し,トークン化します. 純粋な視覚政策と比較してトレーニング時間は約40%増加しますが,ピン挿入,ケーブルルーティング,および表面検査などの接触敏感な作業で成功率は大幅に改善します.

テーブルトップ操作: オープンアームベース

標準的なテーブルトップピックアンドプレイス,アセンブリ,ツール利用のタスクでは, [OpenArm Base] (T12) は拡散政策作業のための最も費用対効果の高いプラットフォームです. 50Hzの共同位置制御で動作し,拡散政策の参照実装目標である標準的な 6-DOF + グリッパーアクションスペースをサポートし,LeRobot形式でデータをネイティブに輸出します. CNNの拡散政策のバリエーションは, 100回のデモの OpenArmデータセットを使用して,単一のRTX 4090で46時間で電車です.

双手OpenArm設定 (共有マウントフレーム上の2つの腕) において,トランスフォーマー変数は推奨される. 双手からの関節状態ベクトルの追加的な交差注意は,CNN変数が欠けている双手調整パターンを捕捉します.

計算要件

Configuration Minimum Recommended
DP-C (CNN, single camera) RTX 3060 12GB, 32GB RAM RTX 3090 24GB, 64GB RAM
DP-T (Transformer, 3 cameras) RTX 4080 16GB, 64GB RAM RTX 4090 24GB or A100 40GB
DP-T + Wuji tactile (768D obs) RTX 4090 24GB, 128GB RAM A100 80GB or 2x RTX 4090

RCSVの [データサービス] (T13) には,現地コンピューティング能力を超えた拡散ポリシー実行のためのA100トレーニングノードへのアクセスが含まれています.管理されたトレーニング作業は,需要に応じて予定されています. 大規模データセット実行のためのGPU割り当てについて議論するために,私たちと連絡してください.

よく 聞かれる 質問

ロボットにおける拡散政策とは?

拡散政策は,行動予測を否定的な拡散プロセスとして扱う模倣学習アルゴリズムである.推論時に,ランダムなガウスノイズから始まり,現在のロボット観測に基づいて一貫したアクションシーケンスに繰り返し精製する. このアプローチは,多型行動分布を表現できる. 標準行動クローンやACTでさえ苦戦するタスクを完了するための複数の有効な方法. 2023年にコロンビア大学で Chi et al.によって導入された.

ACTではなく 拡散政策を いつ使うべきか?

拡散ポリシーは,あなたのタスクがマルチモダルのデモ (オペレーターが同じタスクを意義ある方法で異なる方法で完了する) を行うとき,正確なエンドポイント制御が必要なとき,またはあなたのデモが高い変異がある場合,よりよい選択です.ACTは推論で速く,トレーニングのために計算が少なく,遅延制限のアプリケーションや GPUリソースが限られているチームにとってより良いものです. 50200のデモによるほとんどのテーブルタスク操作では,ACTと拡散政策が比較的に機能します.詳細な分解については, [ACT vs diffusion policy guide]T14 を参照してください.

拡散政策を訓練するにはどのくらいの時間がかかりますか?

標準的なテーブルトップデータセット (50200エピソード) でCNNベースの拡散ポリシーを訓練する時間は,単一のRTX 3090またはRTX 4090で48時間かかります.トランスフォーマーベースのバリエーションは,同じデータセットサイズのために816時間かかります.トレーニング時間は,データセットサイズとほぼ線形にスケールされます.RCSVのプラットフォームは,設定時間を30分未満に縮小する,事前に設定されたトレーニングパイプラインを提供しています.

拡散政策で 最もうまく機能するハードウェアは?

拡散政策は,最初は精密な,滑らかな軌跡を必要とする課題に基準付けられていた.押す,挿入,ピックアンドプレス.手指レベルでの巧妙な作業では, [Wuji Hand] (T15) (20 DOF,768点触覚) と結合した拡散政策は接触性操作の作業でACTを上回る.テーブル上の腕作業では, [OpenArm Base] (T16) は最も費用対効果の高いプラットフォームである. RCSVは,管理されたデータ収集とトレーニングパイプラインで両方の構成をサポートします.

関連 読書

  • T17 行動 変形機で深層潜水
  • [ALOHA ロボットガイド] T18) ACTと拡散政策のための双手プラットフォーム
  • [ロボミミックガイド]T19) 拡散政策に適合するベンチマークデータセット
  • [模倣学習のための最高のロボット]T20) プラットフォーム比較
  • T21) 20 DOF 拡散政策のための手
  • T22
  • RCSVデータサービス 管理されたデータ収集+訓練パイプライン