ロボット学習の拡散政策:どのように機能するか,いつ使うか (2026)
ロボット操作の拡散政策: 否定が行動を予測する方法,CNNとトランスフォーマー,そしてACTと行動クローンに勝ったとき. 2026年ガイド
拡散ポリシーは接触豊富な巧妙なロボット操作作業のための主要な模倣学習アルゴリズムです. 標準的行動クローン
拡散 政策 は 何 です か
2023年にコロンビア大学で Chi et al. が導入した拡散政策は,画像生成拡散モデル (DDPM, DDIM) からロボットアクション予測にスコアマッチングフレームワークを適用する.観察から単一の次のアクションまたは短いアクションシーケンスを予測する代わりに,政策はランダムなアクション軌道を一貫した高品質な動き計画に繰り返し代入することを学します. その結果は,実践的には,従来の行動クローンよりも,人間の示範データの多型性に対処するのに,かなり良い行動政策です.
基本的な洞察は単純です:人間操作員からロボットデモを収集する際には,異なる操作者が同じ作業を質的に異なる方法で実行します. 対象に左側または右側から近づく,引き出す前に押す,または上側から側に向かって握る. これらはすべて有効で,作業を完了する行動です. 平均二乗エラーで訓練された標準行動クローンモデルでは,これらのモードを平均して,2つの有効な行動の間にあるアクションを生成します.これは通常無効です.拡散政策は,観察されたアクションの完全な条件分布をモデル化するため,各モードから独立した表現とサンプルを生成することができます.
本論文では12つのシミュレーションされたロボット操作作業とリアルロボット操作作業に関する拡散政策を示し,そのうち11件で最新の成果を上げました.リアルロボット作業にはT形ブロックを押すこと,トーティッラに双手式の散布ソース,および1mmの配置容量を持つ精密なツールピック作業が含まれていました.
拡散 政策 の 働き
拡散政策の訓練と推論は,画像ではなくアクションシーケンスのために適応された標準的なDDPMデノイジングフレームワークに従います.
訓練
訓練中に, 騒音スケジュールに従って _T_時間段 (通常 T=100) にわたってガウスの騒音を追加することによって,クリーンアクション軌跡
推論
推論時に,モデルはアクションシーケンスと同じ次元性の純粋なノイズベクトルからスタートします.その後,現在の観測によって導かれ,ノイズコンポーネントを予測するために神経ネットワークに呼びかける各ステップで _K_を指すステップ (通常DDIMではK=10 ,DDPMではK=100) を実行します. Kステップの後,結果は完全なアクションシーケンス (通常は10Hzで16
観測条件は主要な建築選択である.拡散ポリシーでは,2つのエンコードオプションがサポートされています.
- CNNベースの (DP-C): ResNet-18または ResNet-34 のバックボンは画像観測を特徴ベクトルにコード化し,その後プロピオセプティブ状態と融合し,デノイジングCNNを条件にするために使用します.訓練と推論を速くします.シングルカメラ設定に最適です.
- トランスフォーマーベースの (DP-T): ViT型トランスフォーマーが画像トークンをコードし,プロピオセプショントークンと融合する.多カメラセットアップで表現が速い.遅い推論 (120ms vs 40ms RTX 3090).
視野制御を終了する
重要な実装詳細:拡散政策は,後退する地平線アプローチを使用します.政策は,長さ Tp (例えば16ステップ) のアクションシーケンスを予測しますが,再計画前に最初の _Ta_ステップ (例えば8ステップ) を実行します.これは時間一貫性 (長時間 Tp =滑らかな動き) と反応性 (短い Ta =予期しない変化に対する迅速な反応) の間のバランスを生み出します. 標準標準のPp/Ta=2の比率は,ほとんどの操作作業でうまく機能します.
拡散政策とACT:実用的な比較
| Property | Diffusion Policy | ACT (Action Chunking Transformers) |
|---|---|---|
| Multimodal action distributions | Excellent — models full distribution | Good — CVAE captures variance but can mode-average |
| Inference latency (RTX 3090) | 40–120ms (DDIM K=10 to K=100) | ~10ms (single forward pass) |
| Training time (50 demos, RTX 3090) | 4–8 hours (CNN), 8–16 hours (Transformer) | 2–4 hours |
| Temporal consistency | High — denoising produces smooth trajectories | High — action chunking provides consistency |
| Bimanual coordination | Good with transformer variant | Excellent — natively designed for ALOHA bimanual |
| Dexterous hand control (20+ DOF) | Excellent — handles high-dim action spaces well | Moderate — chunk size tuning needed for high DOF |
| Open-source reference implementation | Yes — diffusion_policy repo (Columbia) | Yes — act repo (Stanford) |
| LeRobot integration | Yes — native support | Yes — native support |
タイトル比較:ACTは推論で速く,訓練が容易で,時間的に重要なシステムや計算能力が限られているチームにとってよりよい.拡散政策は多型示範を自然に処理し,手腕のような高次元アクションスペースにより良くスケールします. 実践的には,50
拡散政策と標準行動クローン
標準行動クローン (BC) は予測された行動と実証された行動間のMSEを最小限に抑える.この方法は,示例データセットが単模型のとき,すべてのオペレーターが同じ方法で作業を行うとき,動作します.問題は,人間の示例はほとんど決してないことです. BC ポリシーが,次の2つの異なる行動によるデモで出現した観察を観察すると,それを平均し,両例で誤った動きを生成します.これをモード平均の問題と呼びます.
拡散政策は,条件付き平均 E (アクション) ではなく,全体的な条件付き分布をモデル化しているため,モード平均を回避します. 同じ曖昧な観察を考慮すると,拡散政策は,いずれかのモードから一貫してサンプルを採取します. そのため,元の論文では,最も高い示範差が示された課題に対して BCと比較して最大の改善を示した. 推進作業 (オペレータはブロックを異なる角度から押し) と双手散布作業 (オペレータは異なる調整戦略を使用した).
作業の差が示された軌道の5%未満である場合 (つまり,すべての操作者はまったく同じことを行う) 実践的には,良い脊椎を持つBCは拡散政策に一致する.あなたの作業は自然差が
拡散 政策 を 選ぶ 時
拡散ポリシーを選択する
- あなたのデモは多型です. 異なるオペレーターが,意味のある異なる動き戦略を通じて作業を完了した場合,拡散政策はACTまたはBCよりもうまく処理します.
- あなたはDOFの高いアクションスペースを持っています. Dexterous hands (16
20+DOF) は,ACTの固定部品ベースのアプローチよりも,全アクション次元における関節関係をモデル化する拡散政策の能力によりより恩恵を受けています. - 精密なエンドポイント定位が必要である. 原稿は,デノイジング中に繰り返す精錬による精密な挿入作業で2mm以下の配置精度を達成する拡散方針を示した.
- あなたは公表された結果に対してベンチマークを行っている. 最近の論文 (2024~2026) の多くでは,拡散政策が基線として報告されています.
- **訓練のためのGPU予算が多くなります.**複数のGPUがあれば,拡散政策のトレーニングはうまく並行し,トランスフォーマー変数はより計算によりより良い結果が得られます.
ACT を選択する
- インフェレンスの遅延は極めて重要です. 1 つのインフェレンスのステップで10ms で,ACT は適度にハードウェアで100Hz で実行できます. 40
120ms での拡散ポリシーはK=10 100 で8 25Hz で終了します. - ALOHA形式の双手データで作業しています. ACTはALOHAのために設計され,参照実装にはフォーマット変換は必要ありません.
- 訓練計算は限られています. 2時間 ACTトレーニングは,作業設計を迅速に繰り返している場合,拡散政策の問題では4
8時間です. - あなたは特定の先の結果に一致しています. もしスタンフォードの ACT数を正確に複製する必要があるなら,ACTを使用してください.
拡散政策の主要なハイパーパラメータ
針を実際に移動させるパラメーターは,
| Parameter | Default | Effect of Increasing |
|---|---|---|
pred_horizon (Tp) |
16 | Smoother trajectories; slower re-planning; more memory |
action_horizon (Ta) |
8 | Fewer inference calls; less reactive to perturbations |
obs_horizon |
2 | More temporal context; helps with tasks requiring memory of recent motion |
num_diffusion_iters (K) |
10 (DDIM), 100 (DDPM) | Higher quality actions; slower inference |
noise_scheduler |
DDIM | DDPM is higher quality but 10x slower; DDIM preferred for real-time use |
vision_encoder |
ResNet-18 | ResNet-34 / ViT improves performance; requires more compute |
n_obs_steps |
2 | Stacking more observation frames helps tasks with motion-based cues (sliding, rotating) |
放送政策 (コロンビア参照実装) git clone
拡散政策にうまく対応するデータセット
拡散政策は,以下の特徴を持つデータセットで最もよく表れています:
- スムーズで連続した軌跡: 消化プロセスがスムーズな出力を生み出すため,揺れ動いたり不連続した動きによる示例は,モデルの誘導偏見と訓練データとの間に不一致を作り出す.
- **エンドエフェクター状態の一貫した記録:**標準のCNN変数における拡散ポリシーでは,関節角ではなく,エンドエフェクター位置+指向+グリッパーを動作として使用します.データセットが関節角を記録する場合は,前向きの кинеマティック層が必要になります.
- **利用可能な場合,複数のビュー:**トランスフォーマー変数 (DP-T) は,2
3カメラビューをトークンとして使用できます.マルチビュー設定は,遮断または深度曖昧さのある作業でシングルビューを一貫して上回ります.
拡散政策に適合する公開基準データセット
| Dataset | Tasks | Notes |
|---|---|---|
| Push-T (Columbia) | T-block pushing | Reference benchmark; highly multimodal; download from diffusion_policy repo |
| RoboMimic | Can, Lift, Square, Transport | Standard benchmark; MH (multi-human) subset tests multimodal handling best |
| ALOHA / ACT datasets | Bimanual tabletop tasks | Requires joint-space conversion; diffusion policy-T performs comparably to ACT |
| DROID (Google) | 76,000 diverse robot episodes | Large-scale; good for fine-tuning pretrained diffusion models |
| RCSV custom datasets | Varies by project | Delivered in LeRobot format; compatible with diffusion_policy repo out of the box |
拡散政策に関するRCSVハードウェア勧告
精一杯の任務: ウジの手
指のレベルの技巧を要求する作業では,手操作,握 adjustment,オブジェクトのリオーリентаーションでは,RCSVの拡散政策のための最も強力なプラットフォームである.RCSVの20のアクティブDOFと指先の768点触覚センサーにより,拡散政策のトランスフォーマー変数が完全に利用できる豊富なアクションスペースと豊富な観測空間の両方を提供します. 内部基準では,Wuji Handの拡散ポリシー-Tは接触型指相互作用の課題で ACTを18
768点のタクチルマリーは,手当たり768次元観測ベクトルを生成し,DP-Tトランスフォーマーのために平ら化し,トークン化します. 純粋な視覚政策と比較してトレーニング時間は約40%増加しますが,ピン挿入,ケーブルルーティング,および表面検査などの接触敏感な作業で成功率は大幅に改善します.
テーブルトップ操作: オープンアームベース
標準的なテーブルトップピックアンドプレイス,アセンブリ,ツール利用のタスクでは, [OpenArm Base] (
双手OpenArm設定 (共有マウントフレーム上の2つの腕) において,トランスフォーマー変数は推奨される. 双手からの関節状態ベクトルの追加的な交差注意は,CNN変数が欠けている双手調整パターンを捕捉します.
計算要件
| Configuration | Minimum | Recommended |
|---|---|---|
| DP-C (CNN, single camera) | RTX 3060 12GB, 32GB RAM | RTX 3090 24GB, 64GB RAM |
| DP-T (Transformer, 3 cameras) | RTX 4080 16GB, 64GB RAM | RTX 4090 24GB or A100 40GB |
| DP-T + Wuji tactile (768D obs) | RTX 4090 24GB, 128GB RAM | A100 80GB or 2x RTX 4090 |
RCSVの [データサービス] (
よく 聞かれる 質問
ロボットにおける拡散政策とは?
拡散政策は,行動予測を否定的な拡散プロセスとして扱う模倣学習アルゴリズムである.推論時に,ランダムなガウスノイズから始まり,現在のロボット観測に基づいて一貫したアクションシーケンスに繰り返し精製する. このアプローチは,多型行動分布を表現できる. 標準行動クローンやACTでさえ苦戦するタスクを完了するための複数の有効な方法. 2023年にコロンビア大学で Chi et al.によって導入された.
ACTではなく 拡散政策を いつ使うべきか?
拡散ポリシーは,あなたのタスクがマルチモダルのデモ (オペレーターが同じタスクを意義ある方法で異なる方法で完了する) を行うとき,正確なエンドポイント制御が必要なとき,またはあなたのデモが高い変異がある場合,よりよい選択です.ACTは推論で速く,トレーニングのために計算が少なく,遅延制限のアプリケーションや GPUリソースが限られているチームにとってより良いものです. 50
拡散政策を訓練するにはどのくらいの時間がかかりますか?
標準的なテーブルトップデータセット (50
拡散政策で 最もうまく機能するハードウェアは?
拡散政策は,最初は精密な,滑らかな軌跡を必要とする課題に基準付けられていた.押す,挿入,ピックアンドプレス.手指レベルでの巧妙な作業では, [Wuji Hand] (
関連 読書
T17 行動 変形機で深層潜水 - [ALOHA ロボットガイド]
T18 ) ACTと拡散政策のための双手プラットフォーム - [ロボミミックガイド]
T19 ) 拡散政策に適合するベンチマークデータセット - [模倣学習のための最高のロボット]
T20 ) プラットフォーム比較 T21 ) 20 DOF 拡散政策のための手 T22 - RCSVデータサービス
管理されたデータ収集+訓練パイプライン







