拡散政策とACT:どの模倣学習アルゴリズムを選びますか?
拡散政策 (DDPMアクション・チャンキング) と ACT (モバイル ALOHA から CVAE トランスフォーマー) <unk> 多モードキャプチャ,データニーズ,推論速度,双手フィットを比較する.
現代のロボット工学において最も普及している模倣学習アルゴリズムのうち2つ 拡散を否定する上で構築されたもので,もう1つはモバイルALOHAプロジェクトからのCVAEトランスフォーマーで構築されたものです.
更新された2026年4月 MITライセンスによるアクション・チャックリング
[すべてのモデルを閲覧する] [Demoデータを収集する]
TL;DR Difusion Policyは,演示が"複数の有効な方法"を示しているときに,黄金標準を否定するDDPMを通じて専門家の行動の多モード分布をモデル化します. ACT (Action Chunking Transformer) は,学習された潜伏式の
なぜこの比較が重要なのか
公開アーム (OpenArm)
デザインは,デザインのデザインを,デザインのデザインに,デザインのデザインを,デザインのデザインに,デザインのデザインに,デザインのデザインに,デザインのデザインに,デザインのデザインに,デザインのデザインに,デザインのデザインに,デザインのデザインに,デザインのデザインに,デザインのデザインに,デザインのデザインに,デザインのデザインに,デザインのデザインに,デザインのデザインに,デザインのデザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに
瞬間の比較
| Dimension | Diffusion Policy | ACT (Action Chunking Transformer) |
|---|---|---|
| Origin | Chi et al., Columbia, RSS 2023 | Zhao et al., Stanford (Mobile ALOHA), RSS 2023 |
| Architecture | CNN or transformer backbone + conditional diffusion (DDPM) action head | ResNet visual encoder + transformer encoder-decoder with CVAE latent |
| Action representation | Chunk of future actions denoised from Gaussian noise | Chunk of future actions decoded autoregressively (or in parallel) |
| Training objective | Denoising score matching / DDPM loss | Reconstruction + KL regularizer (CVAE) |
| Typical chunk size | 8–16 steps | 50–100 steps (aggressive chunking) |
| Multi-modal capture | Strong — native to the diffusion formulation | Partial — latent captures some multi-modality but can mode-collapse |
| Data needed | ~50–200 demos for narrow tasks; more helps | ~50 demos often enough for bimanual teleop tasks |
| Training time | Slower (diffusion steps increase wall-clock) | Fast — minutes to hours on a single GPU |
| Inference speed | Needs iterative denoising; DDIM or consistency models help | Fast single forward pass; chunked execution amortizes |
| Best-known wins | Push-T, real-world manipulation with multi-modal demos (+46.9% vs prior methods) | Mobile ALOHA bimanual tasks, dexterous bimanual manipulation |
| License | MIT | MIT |
| Code | github.com/real-stanford/diffusion_policy | github.com/tonyzhaozh/act |
拡散政策:分布をモデル化する,平均ではなく
拡散政策の洞察は,専門家による示例はほとんど常に多モードであるということです. 杯を握っている人間のテレオペレータは,異なる試験でサイドグリップまたはトップグリップを使用する場合があります. そのデータに基づいて訓練された伝統的なMSEまたはクロスエントロピー政策は,両方を平均し,どちらも生成しません. 拡散政策は,デノイジング ディフュージョン・プロボビリスティック・モデル (DDPM) を介して行動の _分布_をモデル化することでこれを回避します.推論時に,あなたはノイズベクトルをサンプルを採取し,視覚観測に基づいて動作の部分に繰り返しデノイジングします.
[原稿の拡散政策]
拡散 政策 が 輝く 時
- 示例には複数の有効な戦略 (手柄タイプ,アプローチ方向,手渡し変数) が含まれています.
- 接触に富んだ操纵
接触に富んだ操纵ガイド [ T8 ]を参照してください. - 断乱に対する強さに関心があり 繰り返し否定する推論のための予算があります
- 政策は 安定した状態ではなく データを増やして 拡大させたいのです
簡単なトランスフォーマーで 双手な王冠を盗んだ
ACTは,参考模倣学習スタックとしてモバイル ALOHA と ALOHA の双手硬件とともに導入された.アーキテクチャは意図的にシンプルである.ResNet はカメラビューをコードし,トランスフォーマーエンコードーはプロピオセプションと融合し,トランスフォーマーデコーダーは学習された CVAE 潜伏に基づいて50
ACTの魔法は,部品の長さと組み立てです.遠い将来の行動を予測することで,ステップバイ・ステップ模倣学習の古典的な"複合エラー"の問題を回避します.重複した部品を組み立てることで,高周波の騒音を平均します. 結果:双手テレビ作業 (カップスタッキング,ベルコローストラップ,バッテリー挿入) では,ACTは定期的に50回のデモで成功する.標準的な行動クローン基線では数千回のCLOONが必要になります.ACTはデフォルトで (ALOHAリグの開始ポリシー)
ACTが輝く時
- ACTはこれのために設計され,それが示されています.
- 拡散が収束するのを待つよりも 作業設計を速く繰り返す必要があります
- 制御頻度は重要で ループで繰り返し否定を 望まない
- 示例は比較的一貫している (単一の戦略が優先される).
データ要求
2つのアーキテクチャは,現代的なVLA標準によってデータ効率的です. 7Bモデルを細かく調整するのではなく,狭いタスクでゼロからトレーニングしています.実践では,50回のデモは,ACTを双手操作タスクで合理的な成功率に導くでしょう.そして,拡散ポリシーでは,通常,多モダルのタスクでACTに一致する100~200回のデモが必要です (その後,デモスケールとしてそれを上回ります). データをまだ収集していない場合は, [RCSVの遠隔操作サービス]
引入と展開
ACTのシングルフォワードパスにより,より簡単なデプロイ目標となる.タイムロマング・アンセッリングによる断片実行は,ラップトップGPUで30
誠実な妥協
ACTの優雅さは限界でもある.本当に多モード式示範を持つタスクでは,ACTのCVAEは平均戦略にモード崩壊し,臆病または不決定的な行動を生成する.拡散政策の分布式モデリングはこれを優雅に処理するが,推論複雑性とトレーニング時間を追加する. 効果のあるヒューリスティック: _もしあなたのデモが一貫しているなら ACTから始め,もしあなたのデモが多様であるなら,拡散政策から始め.
両アルゴリズムは"ただ"の模倣学習です. 基礎VLAのように実施形態を一般化しません. 交互ロボット転送が必要な場合は,それらのいずれかを [OpenVLA]
参考基準
建築の2つの要素は[LIBERO]
実行の詳細が実際に重要
両アルゴリズムはVLAの論文のほとんどは示唆するよりもシンプルですが 成功や失敗を決定する詳細は抽象的に失われます **ディフュージョン・ポリシーの場合,最も一般的な3つの罠は: (1) 指示器を不足させるチームが200Kが日常的に必要とされるときに50Kのステップで停止する (2) 動作正常化を誤った調整する,特に行動には位置とグリッパービットの両方が含まれている場合,および (3) 結論にEMAの重量を使用しないこと.これらの3つのことを正しく行うと,ディフュージョン・ポリシーは驚くような一連の作業で"ちょうど動作します".
ACTでは,重要なノブは,断片長さと時間的な組み立ての利益である.短断断片 (20ステップ未満) は,ACTをヴァニラ行動クローンのように振る舞わせ,複合エラーを再導入させる.非常に長い断片 (200以上) は,政策を混乱に脆弱にする. 軸軸重組の100ステップの ALOHAデフォルトは,強い出発点です 振動が見えたらだけダウンする 長い地平線の漂移が見えたらだけアップする.
基礎 VLA で両方を組み合わせる
2026年,生産スタックが増加する数は only ACTまたは only Diffusion Policyを選択しない. 基礎VLAの背後にある低レベルのアクションヘッドとして使用する.パターン: [OpenVLA]
費用と技術的努力
現代の標準では,どちらも高額ではありません.単一の24GBGPU (RTX 4090またはA6000) は,50デモデータセットでACTまたはディフュージョンポリシーを1日以内で訓練します.ACTは通常壁時計の観点から,毎ステップが単一のトランスフォーマーであるため,より速く収束します.ディフュージョンポリシーの多段階損失はより重く,しかし,より少ない時代で収束します. 狭い課題に関する適切な政策のために 合計4
推奨事項
双手テレビのタスクは,特に ALOHA または G1 スタイルハードウェアでは ACTで開始します.午後中に実行され,50のデモでベースラインは困難です. 複数のデモや接触豊富なタスクで単腕操作は, Difusion Policyで開始します. 双方の成功や失敗が データのセットについて重要なことを教えてくれます 双方の成功や失敗が paralelで実行できるほど安いです
関連読み物 OpenVLA vs Octo → RT-X vs OpenVLA → ベストVLAモデル2026 → 拡散政策モデルページ → ALOHAデータセット → テレオップデータ収集 →
ビデオの各部には 自分のデモで調整できます







