VLA Modelsに戻る

拡散政策とACT:どの模倣学習アルゴリズムを選びますか?

拡散政策 (DDPMアクション・チャンキング) と ACT (モバイル ALOHA から CVAE トランスフォーマー) <unk> 多モードキャプチャ,データニーズ,推論速度,双手フィットを比較する.

現代のロボット工学において最も普及している模倣学習アルゴリズムのうち2つ 拡散を否定する上で構築されたもので,もう1つはモバイルALOHAプロジェクトからのCVAEトランスフォーマーで構築されたものです.

更新された2026年4月 MITライセンスによるアクション・チャックリング

[すべてのモデルを閲覧する] [Demoデータを収集する]

TL;DR Difusion Policyは,演示が"複数の有効な方法"を示しているときに,黄金標準を否定するDDPMを通じて専門家の行動の多モード分布をモデル化します. ACT (Action Chunking Transformer) は,学習された潜伏式の 暗黙の単純な行動に基づいて将来の行動の塊を予測し,高速な電車で,双手動のテレオップデータで輝く CVAE トランスフォーマーを使用します. 拡散政策は多モードの強度で勝利する ACTはシンプルさ,トレーニング速度,双手フィットで勝利する

なぜこの比較が重要なのか

公開アーム (OpenArm) T2 (ALOHA) T3 (Unitree G1) T4 (T) この2つのアーキテクチャは純粋な模倣学習の現在のデフォルトを定義します:どちらもアクションチャッキングを使用し,どちらもMITライセンスがあり,どちらも [LeRobot] (T5) で参照実装を持っています.そしてどちらも20242026のロボット学習論文では,ベースラインとして例行的に引用されています.

デザインは,デザインのデザインを,デザインのデザインに,デザインのデザインを,デザインのデザインに,デザインのデザインに,デザインのデザインに,デザインのデザインに,デザインのデザインに,デザインのデザインに,デザインのデザインに,デザインのデザインに,デザインのデザインに,デザインのデザインに,デザインのデザインに,デザインのデザインに,デザインのデザインに,デザインのデザインに,デザインのデザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに,デザインに

瞬間の比較

Dimension Diffusion Policy ACT (Action Chunking Transformer)
Origin Chi et al., Columbia, RSS 2023 Zhao et al., Stanford (Mobile ALOHA), RSS 2023
Architecture CNN or transformer backbone + conditional diffusion (DDPM) action head ResNet visual encoder + transformer encoder-decoder with CVAE latent
Action representation Chunk of future actions denoised from Gaussian noise Chunk of future actions decoded autoregressively (or in parallel)
Training objective Denoising score matching / DDPM loss Reconstruction + KL regularizer (CVAE)
Typical chunk size 8–16 steps 50–100 steps (aggressive chunking)
Multi-modal capture Strong — native to the diffusion formulation Partial — latent captures some multi-modality but can mode-collapse
Data needed ~50–200 demos for narrow tasks; more helps ~50 demos often enough for bimanual teleop tasks
Training time Slower (diffusion steps increase wall-clock) Fast — minutes to hours on a single GPU
Inference speed Needs iterative denoising; DDIM or consistency models help Fast single forward pass; chunked execution amortizes
Best-known wins Push-T, real-world manipulation with multi-modal demos (+46.9% vs prior methods) Mobile ALOHA bimanual tasks, dexterous bimanual manipulation
License MIT MIT
Code github.com/real-stanford/diffusion_policy github.com/tonyzhaozh/act

拡散政策:分布をモデル化する,平均ではなく

拡散政策の洞察は,専門家による示例はほとんど常に多モードであるということです. 杯を握っている人間のテレオペレータは,異なる試験でサイドグリップまたはトップグリップを使用する場合があります. そのデータに基づいて訓練された伝統的なMSEまたはクロスエントロピー政策は,両方を平均し,どちらも生成しません. 拡散政策は,デノイジング ディフュージョン・プロボビリスティック・モデル (DDPM) を介して行動の _分布_をモデル化することでこれを回避します.推論時に,あなたはノイズベクトルをサンプルを採取し,視覚観測に基づいて動作の部分に繰り返しデノイジングします.

[原稿の拡散政策]T6) は15つのタスクで以前の最良の模倣学習方法よりも46.9%の平均改善を報告し,アーキテクチャは下流作業 (例えば [Octo]T7) と3D拡散政策のための裏支となった.コストは推論である:天才な実装は,分ごとにK拡散ステップを実行し,制御ループを10Hz以下に押し付けることができます. ほとんどの生産部署は,リアルタイム制御を得るために 510ステップ,または一貫性蒸留された変 variant を含むDDIM を使用します.

拡散 政策 が 輝く 時

  • 示例には複数の有効な戦略 (手柄タイプ,アプローチ方向,手渡し変数) が含まれています.
  • 接触に富んだ操纵 接触に富んだ操纵ガイド [T8]を参照してください.
  • 断乱に対する強さに関心があり 繰り返し否定する推論のための予算があります
  • 政策は 安定した状態ではなく データを増やして 拡大させたいのです

簡単なトランスフォーマーで 双手な王冠を盗んだ

ACTは,参考模倣学習スタックとしてモバイル ALOHA と ALOHA の双手硬件とともに導入された.アーキテクチャは意図的にシンプルである.ResNet はカメラビューをコードし,トランスフォーマーエンコードーはプロピオセプションと融合し,トランスフォーマーデコーダーは学習された CVAE 潜伏に基づいて50100の将来のアクションを輸出する. 結論付け時に タイムロマリング (平均重複予測) で 部品を実行します これは出力を平滑化し 複合エラーを減らすのです

ACTの魔法は,部品の長さと組み立てです.遠い将来の行動を予測することで,ステップバイ・ステップ模倣学習の古典的な"複合エラー"の問題を回避します.重複した部品を組み立てることで,高周波の騒音を平均します. 結果:双手テレビ作業 (カップスタッキング,ベルコローストラップ,バッテリー挿入) では,ACTは定期的に50回のデモで成功する.標準的な行動クローン基線では数千回のCLOONが必要になります.ACTはデフォルトで (ALOHAリグの開始ポリシー) T9),LeRobotのフレームワークは,定規的なACT実装を実行します.

ACTが輝く時

  • ACTはこれのために設計され,それが示されています.
  • 拡散が収束するのを待つよりも 作業設計を速く繰り返す必要があります
  • 制御頻度は重要で ループで繰り返し否定を 望まない
  • 示例は比較的一貫している (単一の戦略が優先される).

データ要求

2つのアーキテクチャは,現代的なVLA標準によってデータ効率的です. 7Bモデルを細かく調整するのではなく,狭いタスクでゼロからトレーニングしています.実践では,50回のデモは,ACTを双手操作タスクで合理的な成功率に導くでしょう.そして,拡散ポリシーでは,通常,多モダルのタスクでACTに一致する100~200回のデモが必要です (その後,デモスケールとしてそれを上回ります). データをまだ収集していない場合は, [RCSVの遠隔操作サービス]T10) は,両方のアーキテクチャが期待する2050Hz双手録画をキャプチャし, [ALOHAデータセットページ]T11) は,準備済みスタートコーポレーションを持っています.

引入と展開

ACTのシングルフォワードパスにより,より簡単なデプロイ目標となる.タイムロマング・アンセッリングによる断片実行は,ラップトップGPUで3050Hzで快適に実行される.ディフュージョン・ポリシーの反復式デノイジングは,より難しいケースである.しかし,DDIMは510ステップまたは一貫性蒸留したバリエーションでDDIMに収束し,競争的な周波数へと導致している. 端末を配置している場合は ACTに向かって傾けます. 4090以上の作業台で動作している場合は,いずれも大丈夫です.

誠実な妥協

ACTの優雅さは限界でもある.本当に多モード式示範を持つタスクでは,ACTのCVAEは平均戦略にモード崩壊し,臆病または不決定的な行動を生成する.拡散政策の分布式モデリングはこれを優雅に処理するが,推論複雑性とトレーニング時間を追加する. 効果のあるヒューリスティック: _もしあなたのデモが一貫しているなら ACTから始め,もしあなたのデモが多様であるなら,拡散政策から始め.

両アルゴリズムは"ただ"の模倣学習です. 基礎VLAのように実施形態を一般化しません. 交互ロボット転送が必要な場合は,それらのいずれかを [OpenVLA]T12) または [Octo]T13) と組み合わせ,実施形態特定アクションヘッドとしてACT/Diffusion Policy を使用します.

参考基準

建築の2つの要素は[LIBERO]T14) と Push-T/Robomimic Suite に出ています.

実行の詳細が実際に重要

両アルゴリズムはVLAの論文のほとんどは示唆するよりもシンプルですが 成功や失敗を決定する詳細は抽象的に失われます **ディフュージョン・ポリシーの場合,最も一般的な3つの罠は: (1) 指示器を不足させるチームが200Kが日常的に必要とされるときに50Kのステップで停止する (2) 動作正常化を誤った調整する,特に行動には位置とグリッパービットの両方が含まれている場合,および (3) 結論にEMAの重量を使用しないこと.これらの3つのことを正しく行うと,ディフュージョン・ポリシーは驚くような一連の作業で"ちょうど動作します".

ACTでは,重要なノブは,断片長さと時間的な組み立ての利益である.短断断片 (20ステップ未満) は,ACTをヴァニラ行動クローンのように振る舞わせ,複合エラーを再導入させる.非常に長い断片 (200以上) は,政策を混乱に脆弱にする. 軸軸重組の100ステップの ALOHAデフォルトは,強い出発点です 振動が見えたらだけダウンする 長い地平線の漂移が見えたらだけアップする.

基礎 VLA で両方を組み合わせる

2026年,生産スタックが増加する数は only ACTまたは only Diffusion Policyを選択しない. 基礎VLAの背後にある低レベルのアクションヘッドとして使用する.パターン: [OpenVLA]T16のようなVLAは自然言語の指示をシーン意識のあるサブゴールに解析し,ACTまたは Diffusion Policyヘッドは細かな動きを実行します. 2025年の最も優れたCALVINと LIBEROの投稿の多くはこのように構成され,この分野における労働の分断が成熟しているのが反映されています. 言語と抽象のための基礎モデル,巧妙な実行のための模倣学習政策.

費用と技術的努力

現代の標準では,どちらも高額ではありません.単一の24GBGPU (RTX 4090またはA6000) は,50デモデータセットでACTまたはディフュージョンポリシーを1日以内で訓練します.ACTは通常壁時計の観点から,毎ステップが単一のトランスフォーマーであるため,より速く収束します.ディフュージョンポリシーの多段階損失はより重く,しかし,より少ない時代で収束します. 狭い課題に関する適切な政策のために 合計412時間の訓練を期待する 警告は,データ収集とキュレーションは訓練自体よりもはるかに長い時間がかかるということです

推奨事項

双手テレビのタスクは,特に ALOHA または G1 スタイルハードウェアでは ACTで開始します.午後中に実行され,50のデモでベースラインは困難です. 複数のデモや接触豊富なタスクで単腕操作は, Difusion Policyで開始します. 双方の成功や失敗が データのセットについて重要なことを教えてくれます 双方の成功や失敗が paralelで実行できるほど安いです

関連読み物 OpenVLA vs Octo → RT-X vs OpenVLA → ベストVLAモデル2026 → 拡散政策モデルページ → ALOHAデータセット → テレオップデータ収集 →

ビデオの各部には 自分のデモで調整できます

デモを集める → それを実行するハードウェア → ポリシーをスコア →