Researchに戻る

ACT vs Diffusion Policy: どのロボット学習アルゴリズムを使うべきか (2025)

ACT vs 拡散政策: 建築の深層,基準番号,実装コード,そしてロボット学習作業のためのトランスフォーマーと拡散政策のアクション・チャンキングと選択するための明確な枠組み.

[模倣学習ガイド]

[←研究]

模倣学習のための 変形器と拡散政策のアクション・チャンキングと

重要な違いは,その2つのアルゴリズムがどのように行動を表現し生成するかです

デモ・ポリシー ロボット

ACT(Action Chunking with Transformers) とディフュージョン・ポリシーは2025年時点でロボット操作研究において最も広く使用されている模倣学習アルゴリズムである. 作業の構造,データ予算,推論の制約,そして実行の複雑さを吸収する程度に依存します.この記事は,その決定をするために十分な精度で違いを明らかにします.

ACTとは何か?

ACTはスタンフォード大学でトニー・シャオ等が"低コストハードウェアで精細な二手操作を学ぶ" (RSS 2023) という論文で導入した.重要な洞察は アクション・チャンキングです. これにより,効果的な意思決定頻度が低下し,単段階予測による複合エラーを軽減する.

ACTはCVAE (条件変異自動エンコーダー) のアーキテクチャを使用します.トレーニング中に,エンコーダーは完全に示されたアクションシーケンスをスタイルの潜伏式 T3にマッピングします.トランスフォーマーデコーダーは,現在の画像観測と T4によるアクションの部分を予測します.結論として, T5は先 (ガウス単位) からサンプルを採取します. タイムアンサンブル 平均的な重複した部分予測 実行をさらにスムーズにする.

ACT 建築 ひと目で見る

  • バックボーン: ResNet-18 または ResNet-50 画像コーディング;標準トランスフォーマーエンコード・デコーダー
  • アクション表示: 連続した関節位置,長さの _k_の部分として予測される (デフォルト: 100 50 Hz = 2秒)
  • 損失: L1 行動塊の回帰 + KL スタイルの潜伏の差
  • インフェレンスの速度: 速さ 単一の前進パスで全部の部品が作られる. 部品の再利用で50Hzで効果的な制御
  • パラメータ: ~85M (ResNet-50+トランスフォーマーでACT)

拡散 政策 は 何 です か

拡散政策は,コロンビア大学とMITのチ・エト・アールによって"拡散政策:行動拡散による視覚運動政策学習" (RSS 2023) で導入された.ロボット政策学習は,条件付きの拡散プロセスを否定する形で再構成される.訓練時に,騒音は,専門家のアクションシーケンスに徐々に追加される. モデルは,このプロセスを逆転させることを学んでいます. 騒音な行動と現在の観測により,クリーンアクションを予測します.

推論では,行動はガウスの騒音から始まり,繰り返し _T_ステップ (通常はDDPMで10100ステップ,またはDDIM加速で110ステップ) を否定することによってサンプル化されます.これは,各呼び出しで完全なアクション予測視界 (通常は816ステップ) を生成します. 拡散プロセスの多型性により,ポリシーは同じ観察から任務を完了するための複数の有効な方法を表すことができます.

拡散政策の架構

  • **バックボーン:**画像のCNNエンコード;ノイズ予測ネットワークは,アクションシーケンスのU-ネットまたはトランスフォーマー (DiT型)
  • アクション表示: 予測の地平線 H (通常816ステップ) 上で連続した関節位置またはエンドエフェクターポーズ
  • 損失: スコアマッチングを否定する (ノイズ予測に関するMSE)
  • インファレンスのスピード: ACTより遅い 動作クエリごとにステップを _T_に指定する必要があります. DDIMはこれを大幅に削減します (10ステップインファレンスの実践)
  • パラメータ: ~70300M 脊髄選択によって

比較 対象

Dimension ACT Diffusion Policy
Core mechanism CVAE + transformer, predicts action chunk directly Conditional denoising diffusion over action horizon
Multimodal action distributions Limited — CVAE latent provides some coverage but collapses on complex distributions Excellent — diffusion naturally represents multimodal distributions
Data efficiency High — works well with 50–200 demos Moderate — typically needs 100–500 demos; benefits more from scale
Inference speed Fast — single forward pass, chunk reuse; ~5ms/query on A100 Slower — 10–100 denoising steps; ~50–200ms with DDPM, ~15ms with DDIM on A100
Real-time control Excellent — designed for 50 Hz with temporal ensemble Feasible with DDIM + action horizon receding; requires tuning
Task types where it wins Bimanual manipulation, ALOHA-style tasks, precise assembly, long-horizon tasks with clear structure Dexterous grasping, contact-rich tasks, tasks with multiple valid execution modes
Hardware requirements Single GPU (RTX 3090 sufficient); ~8GB VRAM for inference Single GPU; DDPM needs ~16GB, DDIM feasible on RTX 3090; more latency-sensitive
Implementation complexity Moderate — well-documented, LeRobot reference implementation Higher — denoising schedule tuning, inference step count tradeoffs
Training time (100 demos) ~4–8 hours on a single RTX 4090 ~6–12 hours on a single RTX 4090
Hyperparameter sensitivity Moderate — chunk size and KL weight matter High — noise schedule, diffusion steps, and horizon are all critical
Open-source maturity Very high — original codebase + LeRobot High — original codebase + LeRobot + multiple reproductions

基準番号

論文や再現性研究で報告された結果から以下の数字が得られます. デモ品質,カメラ設定,ロボット校正によって作業の成功率は大きく異なります.

LIBERO 基準 (Chi et al. 複製, 2024)

Suite ACT Success Rate Diffusion Policy Success Rate
LIBERO-Spatial (10 tasks) 84.7% 78.2%
LIBERO-Object (10 tasks) 90.1% 82.4%
LIBERO-Goal (10 tasks) 71.6% 68.9%
LIBERO-Long (10 tasks) 53.8% 48.1%

ALOHA 双手作業 (オリジナル ACT 論文, Zhao et al. 2023)

Task ACT (50 demos) BC-Transformer (50 demos) Diffusion Policy (50 demos)
Slot insertion 62% 24% 38%
Cup unstacking 98% 72% 84%
Bag transfer 100% 44% 58%

RLBench (拡散政策論文, Chi et al. 2023)

多様式アクション分布 (例えば,複数の有効アプローチ方向から選択) の作業では,分散政策は,標準 ACTを含む回帰ベースの政策に対して強い優位性を示しています. +1525%の成功率は,アプローチ角度が曖昧である"プッシュボタン"や"オープン・ドラフト"のような作業では. ACTは平均値に逆転し,これらの上では失敗する.

行動 を 選ぶ 時

  • 双手操作: ACTは ALOHA双手設定のために設計され,同期された双手調整で優れている.アクション部品は,両手間の時間関わりを自然にコードする.
  • 正確な組み立て作業: ペン挿入,蓋挿入,プラグ挿入. 割れ込みメカニズムは,複合位置付け誤りを軽減します.
  • 低デモ予算: 100 件未満のデモがあれば,ACT は通常より信頼性が高いように収束する.CVAE 潜伏は,拡散多様体を埋め込むために何千もの例を必要とせずに十分な表現力を提供します.
  • スピード感受性部署: 適量なハードウェア (例えば,ローカルワークステーション GPU) で50 Hz で実行する必要がある場合,ACT のシングルパス推移は DDPM 拡散よりもはるかに処理可能である.
  • 明確な構造を持つ長視線作業: ACTの2秒分の部分は,各段階が段階間の差異が低い段階 (到達,把握,場所) に分解する作業に適しています.

拡散 政策 を 選ぶ 時

  • 接触不確実性のある外部の操作: 接近角,握り方向,指の配置が複数有効なオプションがある場合,拡散は自然に完全な分布を表します.
  • 曖昧な専門家示範による任務: 遠隔操作データには同じ作業開始状態の複数の異なる戦略が含まれている場合,分散政策は,逆転ベースの方法のように,それらを悪い政策に平均化しません.
  • High-DoF dexterous hands: 指の軌道を計画する際には,固有の多模性がある.
  • スケールでのデータ予算が大きい: CVAE KLの規則化がスケール化できるように,デノイズ目標が表現を崩さないため,拡散政策のパフォーマンスはデータセットのサイズにより改善されます.
  • 国家ベースの (非視覚的) 政策: 独占感受状態から運営する際には,U-Netの拡散政策の脊柱は特に効率的でよく研究されています.

双手事件:ACTが勝利

双手操作では,ALOHA,DK1および類似のプラットフォームによって定義されたタスククラスは,ACTに体系的な優位性がある.アクション・チャックは,予測目標に直接左と右腕のアクション間の時間関係をコードする. ロボットは完全な部分を実行します つまり調整は 予測された軌道を "焼いて" 出てくるのではなく 別に求められた2つの政策から生まれるのです

拡散政策は両腕のアクションスペースを連鎖することで双手利用に適応できますが,次元性が増加すると,デノイジング問題が難しくなり,データ要求が大幅に増加します.この理由で,双手研究を行う研究室 (スタンフォード・ALOHAグループ,UMass,CMU) はACTまたはACT+変異にデフォルトします.

実施: レロボットコードスニッペット

両アルゴリズムは [HuggingFace LeRobot] (T14) で利用できます.

レロボットでACT訓練

python lerobot/scripts/train.py \
  policy=act \
  env=aloha \
  dataset_repo_id=lerobot/aloha_sim_insertion_human \
  hydra.run.dir=outputs/train/act_insertion \
  training.num_workers=4 \
  training.batch_size=8 \
  training.num_epochs=2000 \
  policy.chunk_size=100 \
  policy.n_action_steps=100 \
  policy.temporal_ensemble_momentum=0.01

ACTのキーハイパーパラメータを調節する:

  • T6: 前進パスごとに予測される時間ステップ数.50Hzでデフォルト100 = 2秒.より速いタスクでは50に削減します.
  • T7: 攻撃的に重複する塊が混ざっている程度を制御する. 下 = 滑らかなが,遅い.
  • T8:CVAE KLの用語の重み.デフォルト 10.0. シンプルな作業でポリシーモードが崩壊した場合増加します.

レロボットとの訓練 拡散政策

python lerobot/scripts/train.py \
  policy=diffusion \
  env=pusht \
  dataset_repo_id=lerobot/pusht \
  hydra.run.dir=outputs/train/diffusion_pusht \
  training.num_workers=4 \
  training.batch_size=64 \
  training.num_epochs=2000 \
  policy.n_action_steps=8 \
  policy.horizon=16 \
  policy.num_inference_steps=100 \
  policy.num_train_timesteps=100

調節する鍵の拡散ポリシーハイパーパラメータ:

  • T9:DDIMを推論するステップを告げる.デフォルト100 (DDPM).リアルタイム使用のために1020に設定 (DDIMスケジュラー).
  • T10:完全な予測ウィンドウ.より高い =より平滑な軌跡;より低い =より反応的. 16はテーブル上の作業の良い出発点です.
  • T11: 再び問い合わせする前に実際に実行する視界からのアクションの数. 通常は視界/2です.

スケジュールメーカー間の切り替え (DDPM対DDIM)

# In your config or Python override:
# Use DDIM for fast inference (10 steps instead of 100)
policy.noise_scheduler._target_=diffusers.DDIMScheduler
policy.num_inference_steps=10

# DDIM produces near-identical quality at 10x faster inference
# Benchmark: 100-step DDPM ~180ms → 10-step DDIM ~18ms on RTX 3090

ACT+ と 知ら れる べき 変数

ACT+ (ALOHA Unleashed, 2024) は,さらに多くのトレーニングトリック (ResNet の背骨が大きく,データ拡張が改善され,位置と速度が合致する) を追加して ACT を拡張する.同じALOHA の課題でヴァニラ ACT より15%高い成功率を達成する.ALOHA または DK1 ハードウェアで新しいプロジェクトを開始している場合は,ヴァニラ ACT に比べて ACT+ を好む.

**Difusion Policy Transformer (DP-T) **は,U-Netノイズ予測器をトランスフォーマーに置き換え,よりよい長期間の時間モデリングとスケーリングを可能にします.複雑な作業 (30+秒以上のエピソード) では,DP-TはCNNベースのバリエーションを8%の成功率で上回りますが,計算とデータを増やす必要があります.

結論: 決定の樹

この決定手続きを順守する

  1. 双手操作 → ACT (または ACT+)
  2. 演出が100回未満なら
  3. 結論を10msとすると,
  4. タスクが多型アクション分布を (複数の有効な握り,接近角度) している場合
  5. 色の手制御** (5+指 DoF) → 拡散政策
  6. **大データセット (>500デモ) **とスケーリング → 拡散政策
  7. テストの50回の試行錯誤で2日間の計算を比較する

データの収集の検討

アルゴリズムの両方では,デモ品質は小さなデータシステム (<200 デモ) のアルゴリズム選択よりも重要である.一貫した遠隔操作速度,滑らかな軌跡,良きカメラカバーが支配的に存在する.我々は,完全な収集パイプラインを構築せずに迅速に繰り返したいチームのために,遠隔操作,HDF5/LeRobotフォーマット,QA を提供します.

ハードウェア:ACTはALOHA (低コスト双手) を中心に設計された.ディフュージョンポリシーはハードウェア無知性である.両者はOpenArm 1とDK1でLeRobot SDKで実行されます.

ACTモデルページ → 分散政策モデルページ → VLAモデル比較 →

評価について読むことは"つ 真のハードウェアに関する政策を証明することは"つ

実世界の評価を実行する → 委員会評価データ → 評価装置のためのハードウェア →