Blogに戻る

ACT 対 拡散 政策: 正しい アルゴリズム を 選ぶための 実践 的 な ガイド

機械操作のためのアクション・チャンキングとトランスフォーマー (ACT) とディフュージョン・ポリシーの使用時間 遅延,作業複雑性,トレーニングデータトレードオフ.

[模倣学習ガイド]

[←ブログ]

アルゴリズム選択は データ品質よりも 重要ではないが 適切な選択に十分重要です

簡単な概要

ACT (Action Chunking with Transformers, Zhao et al. 2023) は,CVAEを使用して,同時に予測される20-100の将来のアクションのシーケンスを CVAE で生成する.これは,遅いサンプルを考慮して,決定性的な (50ms の推論) で,動作空間を条件に否定する拡散モデルを使用する. Diffusion Policy (Chi et al. 2023) は,動作空間を条件に否定する拡散モデルを使用する. 遅い (200-500ms DDPM,一貫性蒸留の50ms),明示的に多モダルのもので,より多くのデータで精度作業と多ステップ作業をよりうまく処理します.

推移遅延:実用的な制約

リアルタイムロボット制御では,推論遅延は,他の考慮よりも前にアルゴリズム選択を決定する厳しい制約である.

Algorithm Inference Time Control Hz Notes
ACT 50 ms 20 Hz Executes 20-step chunks; real inference rate much lower
Diffusion Policy (DDPM) 500 ms 2 Hz Too slow for reactive tasks without chunking
Diffusion Policy (DDIM 10 steps) 200 ms 5 Hz Acceptable for slow manipulation
Consistency Policy 50 ms 20 Hz Single denoising step; matches ACT latency
ACT + temporal ensemble 50 ms 20 Hz Smoothing across multiple chunk predictions

作業に反応性高周波制御 (キャッチング,流出,高速組み立て) が必要なら,標準の拡散政策DDPMは単純に遅すぎます.ACTまたは一貫性ポリシーを使用します.作業に遅い精度操作が含まれている場合,200ms遅延が受け入れられる場合,DDIM拡散政策は実行可能であり,より良い結果をもたらす可能性があります.

任務類の勧告

  • 高速反応性作業 (捕獲,動かす,高速ピックアップ): ACTまたは一貫性ポリシー. 20Hz制御速度はリアルタイム調整を可能にします. 2Hzでの拡散 DDPMは動く物体に反応できません.
  • 複数の実行可能なソリューション (ペグインホール,USB挿入,布折) の精度作業: 拡散ポリシー.その明示的な多様式性は,平均戦略がしばしば失敗する精度作業において重要な平均だけでなく,成功する把握戦略における分布をモデル化することを可能にします.
  • 10ステップ以上の長視線作業: アルゴリズムだけでは十分ではありません.階層的なポリシーを使用します.タスクプランナーはサブタスクのシーケンスを選択し,ACTまたはディフュージョンポリシーは個々のサブタスクを実行します.
  • オブジェクトの位置が大きく異なるタスク: 両方とも機能しますが,十分なデータで訓練された場合,拡散ポリシーは新しいオブジェクトの位置によりよく一般化する傾向があります.

訓練データ要件

Algorithm Minimum Demos Recommended Training Time (single GPU)
ACT 50 100–500 2–4 hours
Diffusion Policy (DDPM) 200 500–2000 6–12 hours
Consistency Policy 100 300–1000 4–8 hours

ACTのデータ要求が低く,500以上のデモを集めるのに費用がかかる新しいタスク探索に本当の利点があります.しかし,Difusion Policyは,より多くのデータが利用可能であるときに ACTを追及し,それを上回ります.特に精度作業では. 1,000以上のデモのデータ予算がある場合は,Difusion Policyを真剣に評価してください.

超パラメータ 敏感性

ACTの重要な超パラメータは,CVAE損失におけるKL差分重量である.あまりにも低い:潜伏空間が崩壊し,ポリシーが文脈を無視する.あまりにも高い:ポリシーが示範を無視し,平均に戻る.標準推奨:10から開始し,完全なトレーニングの前に小さなデータセットで1,5,10,50を掃描する.

拡散政策は学習速度のスケジュールとノイズバリエンススケジュールにより敏感である.元のDDPM実装では,線形暖化LRを持つコシナスノイズスケジュールを使用している.これらのデフォルトは実践でうまく機能する.最も一般的な誤りは,接触豊富なデータでトレーニング不安定性を引き起こす学習速度の過剰な使用 (>3e-4とアダム).

決定マトリックス

Condition Recommended Algorithm
< 200 demos available ACT
Reactive/high-speed task ACT or Consistency Policy
精度(再現性) with multi-modal solutions Diffusion Policy
> 500 demos, slow task Diffusion Policy
Deployment on low-compute hardware ACT (lighter model)
Want to use HuggingFace LeRobot Both supported

両アルゴリズムはRCSV [データプラットフォーム] (T3) で参照実装として利用可能であり,OpenArm 1のプリコンフィギュア・トレーニングと一般的なカメラセットアップが備わっている.

ハードの下:ACTアーキテクチャ

ACT (トランスフォーマーによるアクション・チャンキング) は CVAE (条件変異自動エンコーダー) とトランスフォーマーアーキテクチャを組み合わせて 動作のブロックを予測します 20~100の将来のアクションのシーケンスです

エンコーダー: 視覚エンコーダーは,以前訓練されたバックボーン (通常はResNet-18またはViT変数) を介してカメラ画像を処理する. 視覚機能と関節状態 (プロピオセプション) が連鎖される.結合観測はコンテキスト埋め込みを生成するトランスフォーマーエンコーダーに供給される.

**CVAE:**訓練中に,CVAEエンコードは,基礎真実アクションシーケンスと観察を採取して,潜伏変数 z を生成する.推論中に,z は学んできた先 (観察のみで条件付けられている) からサンプルを採取する.潜伏 z は行動の"スタイル"を捕捉する.異なる z サンプルは,異なるが有効な作業の完了戦略を生成する. CVAE損失における KL差分期は,前および後分布が近くにとどまるようにし,試験時に前からサンプルを採取できるようにします.

デコッダ: トランスフォーマーデコッダはコンテキスト埋め込みと潜伏の z を取り,自動退却的にアクション・パートを生成する.各出力位置は,一つのアクションを予測する (通常は7D:6Dエンドエフェクターデルタ +1Dグリッパー).完全なパートは,単一の前進パスで生成される (言語モデルトークンのように繰り返さない),それゆえACTは50msの推論を達成する.

時間集合: ACTは,再観測の各段階において重複するアクションブロックを生成し,指数値重量化 (最近の予測が重量化された) で重複する予測されたアクションを平均する.これは,ブロック間の移行を平滑化し,ブロックの境界線での緊張を軽減します. 集合体重量分解パラメータ (通常は0.01) は,滑らかさと応答力との間のトレードオフを制御します.

フッドの下:拡散政策建築

拡散政策は,ロボット行動予測にDDPM (Denoising Diffusion Probabilistic Model) の枠組みを適用する. 画像の拡散モデルのように,騒音から画像を生成する代わりに,騒音からアクションシーケンスを生成する.

**前進プロセス:**訓練中に,T拡散ステップ (通常T=100でDDPM) に関する基底真実アクションシーケンスに徐々に騒音が追加される.Tステップでは,純粋なガウス騒音です.モデルはこのプロセスを逆転することを学んでいます.Tステップでの騒音アクションと観測により,追加された騒音 (epsilon予測) または清掃アクションを直接予測します.

ネットワークアーキテクチャ: 指定ネットワークは1D U-Net (コンボリュショナルでアクションシーケンスの時間次元を操作する) またはトランスフォーマーである. U-Net バリアンはオリジナルのもので最もテストされている.トランスフォーマー バリアント (DP-T,拡散政策トランスフォーマー) は,より優れたスケーリング特性のために採用されつつある. 両方とも入力として:騒音なアクションシーケンス,拡散時間ステップ t (シヌソイドル埋め込みとしてコード化) と視覚脊髄からの観測コード化をとる.

** 推論:** 純粋なノイズから始まり,モデルはTステップを繰り返しデノイズしてクリーンなアクションシーケンスを生成する.DDPMはT=100ステップ (遅い) を使用する.DDIM (Denoising Diffusion Implicit Models) は,質の損失を最小限に抑えながら,これを10〜20ステップに縮小する. 一貫性蒸留は,ACTの推論速度に合わせて,訓練の複雑さをさらに高めて,単一のステップに整頓するプロセスです.

多様性: ACTよりも拡散政策の核心優点は明示的な多様式アクション分布モデリングである.タスクに複数の有効戦略がある場合 (左対右のアプローチ,上対側から把握),分散モデルは学習分布のすべての有効モードを表示することができます. ACTのCVAEは,潜伏空間を通して複数のモードを表現することもできますが,KLの規則化は,特に訓練データに限った場合,実践でモードを崩壊させる傾向があります.拡散政策は,異なった騒音初期化から異なったモードに収束する可能性があるため,モードをより信頼性が高いように保存します.

ハイブリッドアプローチ:ACTと拡散政策を組み合わせる

両アルゴリズムの強みを組み合わせるハイブリッドアプローチがいくつか登場しました

  • DP-T (分散政策トランスフォーマー): U-Netのデノイズネットワークをトランスフォーマーに置き換え,アクションシーケンスの長さと観測複雑性によりスケーリングが向上します.DDIMの10ステップ推理によるDP-Tは,多モードアクション予測で100ms遅延 (ACTと標準DPの間) を達成します.これは十分な計算を持つチームにとってデフォルト選択です.
  • 一貫性ポリシー: 一貫性トレーニングを使用して訓練された拡散政策を単段階生成器に蒸留します.結果はACTの50ms推論と一致し,分散政策の多モードアクション分布を維持します.トレードオフ:一貫性トレーニングは,全体的なトレーニング時間に50-100%を追加し,一貫性損失の重量の注意深くハイパーパラメーター調整を必要とする.
  • Multi-head予測のACT: 単一のCVAEデコッダーではなく,それぞれ異なるアクション部分を予測するKデコッダーヘッドを使用します.推論では,予測された部分が最近観測と比較して最も低い再構築エラーを有するヘッドを選択します.これはACTレベルの推論速度で離散的なマルチモダリティ (Kモード) を提供します.実践的なK値は3-5です.
  • 階層的な DP + ACT: 低周波 (1-2 Hz) で高レベルのスキル選択 (戦略を把握し,方向に近づく) に,低レベルの軌道を高周波 (20 Hz) で実行する ACT に,拡散ポリシーを使用します.これはDPの多モード計画とACTの迅速な反応制御を組み合わせます.

ハードウェアプラットフォームによるインフェレンスのベンチマーク

配備ハードウェアは,どのアルゴリズムが実行可能かを決定します.これらのベンチマークは標準モデルサイズを使用します (ACT:ResNet-18背骨 + 4層変形器, ~25Mパラメータ;拡散ポリシー:ResNet-18 + 1D U-Net, ~55Mパラメータ;一貫性ポリシー:DPと同じアーキテクチャ,単段階蒸留).

Algorithm RTX 4090 RTX 3060 Jetson Orin (64GB) Jetson Orin Nano Apple M2 (MPS) CPU (i7-13700)
ACT (chunk=50) 12 ms / 83 Hz 35 ms / 28 Hz 50 ms / 20 Hz 120 ms / 8 Hz 65 ms / 15 Hz 180 ms / 5.5 Hz
ACT (chunk=100) 18 ms / 55 Hz 50 ms / 20 Hz 75 ms / 13 Hz 180 ms / 5.5 Hz 95 ms / 10 Hz 280 ms / 3.5 Hz
DP (DDPM, 100 steps) 150 ms / 6.6 Hz 420 ms / 2.4 Hz 600 ms / 1.7 Hz 1800 ms / 0.6 Hz 550 ms / 1.8 Hz 4200 ms / 0.2 Hz
DP (DDIM, 10 steps) 22 ms / 45 Hz 65 ms / 15 Hz 100 ms / 10 Hz 280 ms / 3.6 Hz 85 ms / 12 Hz 650 ms / 1.5 Hz
DP-T (DDIM, 10 steps) 28 ms / 35 Hz 80 ms / 12.5 Hz 120 ms / 8 Hz 350 ms / 2.9 Hz 105 ms / 9.5 Hz 820 ms / 1.2 Hz
Consistency Policy 15 ms / 66 Hz 45 ms / 22 Hz 70 ms / 14 Hz 200 ms / 5 Hz 60 ms / 16 Hz 350 ms / 2.9 Hz

キー観測: DDPM ディフュージョンポリシーはデスクトップGPU以下の何でも使用できない.10ステップでDDIMは,Jetson Orin (10 Hzはほとんどの操作作業に十分) で DPを実用領域に運ぶ.ACTはJetson Orin Nano (8 Hzで chunk=50で) で可視速度で実行する唯一のアルゴリズムである. 一貫性ポリシーは ACTの速度に一致し DPの多モード性特性も保ちます. 訓練時間余裕があれば,中級ハードウェアで最高のオプションです.

モバイルロボット (Unitree G1,RCSVのモバイル ALOHA プラットフォーム) の場合は,ジェットソン・オリンが標準計算モジュールである.これは,あなたの実践的な選択は ACT,DDIM DP,または一貫性ポリシーであることを意味します.DDPM DPはネットワークを通じて接続されたデスクトップGPUでのみ実行可能です (ネットワーク遅延5-15msを追加します.これは遅い作業で受け入れられます).

訓練効率の比較

訓練コストはデータセットサイズ,GPUハードウェア,アルゴリズムに依存します.これらのベンチマークは標準設定を使用します. 2カメラ入力 (224x224), 7-DOFアクションスペース,単一のNVIDIA GPU.

Scenario ACT (A100) ACT (RTX 3060) DP (A100) DP (RTX 3060) CP (A100)
100 demos, 2K epochs 45 min 2.5 hr 2 hr 8 hr 4 hr*
500 demos, 2K epochs 3 hr 12 hr 8 hr 36 hr 16 hr*
2000 demos, 3K epochs 18 hr 72 hr 48 hr 8+ days 96 hr*
Cloud cost estimate (above) $35 N/A (local) $95 N/A (local) $190*

一貫性政策訓練には,基礎DP訓練+一貫性蒸留が含まれます. A100スポットインスタンスのクラウドコストは2ドル/時間です.

ACTは同じデータセットサイズに対して,分散策略よりも34倍速く動作します.データ収集戦略とハイパーパラメータを繰り返すときに,迅速なプロトタイプ作成で重要なことが重要です.典型的な開発サイクルでは,作業策略に収束する前に,510回の電車評価-収集再演を伴う. 地方RTX 3060で500回のデモで,それはACTに対して510日のトレーニングです. DPに対して1530日のトレーニングです.これは単独で,最初のタスク探索のためにACTから始め,データ収集が完了して最大限のパフォーマンスを望むとDPに移行します.

課題レベルでの成功率比較

OpenArm 1 + RealSense D435iに関する公開された評価およびRCSV内部ベンチマークからの原始数字.すべてのポリシーは,それぞれのタスクに対して同じデモデータセットで訓練されています.成功 =デモ時間の2倍以内に完成したタスク.

Task Demos ACT DP (DDIM) CP Winner
Pick cube (single position) 50 92% 85% 88% ACT
Pick cube (random position) 200 78% 84% 82% DP
Peg insertion (tight fit, 1mm) 300 55% 72% 68% DP
Bimanual handover 200 75% 70% 72% ACT
Cloth folding 500 40% 62% 58% DP
Pour liquid (speed-critical) 150 68% 52% 65% ACT
Stack 3 blocks (sequential) 400 35% 48% 45% DP

パターン: ACTはスピード (流し,譲渡) を要求するタスクや小さなデータセット (50個のデモを伴う単位の選択) で勝利する.DPは精度タスク (ペグ挿入),高差異 (ランダムな位置,布折) と長視野タスク (ブロックスタッキング) で勝利する.データセットのサイズが増加するにつれてギャップが縮小する.DPは1000以上のデモですべてのタスクタイプでACTを一貫して上回る.

失敗 の 常見 な 方法 と 誤差 修正

誤差パターンを認識すると,修正はデータ,異なるハイパーパラメータ,またはまったく異なるアルゴリズムであるかどうかを分かります.

ACT特有の失敗

  • モード平均 (接触近くでゆったり振動): ポリシーでは,任意の軌道を生成する有効な2つの戦略 (左から右にアプローチする) を平均する.修正:モードコミットメントを奨励するためにKL重量を増加するか,一貫して1つの戦略を使用する示例を収集する.タスクに固有の多モード行動が必要であれば,拡散ポリシーに切り替える.
  • 断片境界の不連続性 (Nステップごとに突然揺れる): 連続した断片間の時間集合は十分に滑らかしていない.修正:集合重量分解を減少させ (0.005ではなく0.01) または断片重複を増加させ (25ステップではなく10ステップごとに再予測する).
  • 長時間の作業 (>15秒) の変動: ACT は長時間間の累積のエラーを修正するための明示的なメカニズムがありません.ポリシーでは,意図された軌道をゆっくりと離れるオープンループのブロックを予測します.修正:再観測頻度を増やします (完全なブロックを実行するのではなく,5〜10ステップごとに再予測します) またはブロック間の閉ループエラー修正を追加します.

拡散政策の特異性欠陥

  • 乱気への反応が遅い: 100 ステップ DDPM を使用すると,ポリシーは 500ms 間に予期せぬ出来事 (オブジェクト滑り,人間の介入) に反応することはできません.修正:DDIM 10 ステップまたは一貫性ポリシーの変更.反応性サブタスクについては,反応性コンポーネントのためにACT とハイブリッドアーキテクチャを使用してください.
  • トレーニング崩壊 (損失のピーク,NaN梯度): 3e-4以上の学習率または32未満のパッチサイズでよく見られる. 修正: LRを1e-4に減らして,パッチサイズを64+に増やし,梯度カットを1.0で追加する.
  • 過度に滑らかな軌跡 (グリッパーがあまりにもゆっくり開く/閉じる): 拡散消化プロセスは,自然にアクション分布を滑らかにします.これは鋭いグリッパー移行を丸める可能性があります. 修正:訓練中にDDPMステップの数を増やします (100の代わりに200を試してみてください) 鋭い移行を維持するために,または後処理でグリッパー次元を極限 (>0.5 =開いている, <0.5 =閉ざされた) とします.

ONNX エクスポートとテンソRT最適化

エッジハードウェアに展開する際には,ACTとDPの両方がONNX輸出とTensorRT最適化から大きく恩恵を受けています.典型的なスピードアップは:

輸出_act_onnx.py -- 輸出 ACTをONNXへ TensorRTのインポートタッチを lerobot.common.policies.act.modeling_act 輸入 ACT政策 # 読み込み訓練されたチェックポイント政策 = ACT政策.from_pretrained("パス/トゥ/チェックポイント") 政策.eval.() # 観測空間に一致するダミー入力を作成します 観測空間のダミー_obs = { "観察.画像.トップ": torch.randn(1,3,224,224), "観測.im.腕: torch. \n(1,3,224,224), "観測.状態": torch.randn1,14), # 7-DOF 行動_x セット } # 輸出 (NX) 操作. torch.ch.onch.onch.con_obs (), #\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\

TensorRT FP16最適化により,ジェットソンハードウェア上のPyTorchよりも2~3倍のスピードアップが提供されます.ジェットソンオリンでのACTでは50msから18-22msまで推論をもたらします.DDIM DPでは100msから35-45msまでです.FP16の量化には,両方のアルゴリズムに対するポリシー品質に軽視する影響があります (私たちのテストで1%未満の成功率低下).

両 アルゴリズム の 訓練 技巧

# Common training configuration patterns for LeRobot

# ACT config (lerobot/configs/policy/act.yaml)
# Key hyperparameters to tune:
#   chunk_size: 50-100 (longer = smoother but less reactive)
#   kl_weight: 10 (sweep: 1, 5, 10, 50)
#   lr: 1e-4 (reduce to 5e-5 if training is unstable)
#   batch_size: 32-64
#   n_epochs: 2000 (for 200 demos; scale proportionally)

# Diffusion Policy config (lerobot/configs/policy/diffusion.yaml)
# Key hyperparameters:
#   n_diffusion_steps: 100 (DDPM) or 10 (DDIM at inference)
#   prediction_type: "epsilon" (noise prediction; more stable than "sample")
#   lr: 1e-4 with cosine schedule
#   batch_size: 64-128 (DP benefits from larger batches more than ACT)
#   n_epochs: 3000 (for 200 demos; DP converges slower than ACT)

# Both algorithms:
#   - Use action normalization (zero mean, unit variance per dimension)
#   - Use image augmentation (random crop 84-96%, color jitter)
#   - Monitor validation loss every 50 epochs; save best checkpoint
#   - EMA (exponential moving average) of weights at 0.9999 decay

関連 読書

  • [ロボットのための模倣学習:デモから部署まで]
  • [LeRobot フレームワーク: スタートガイド]
  • [ロボット政策一般化:なぜロボットが新しい物体で失敗する]
  • [ロボット学習のスケーリング法:2026年我々が知っていること]
  • [ロボット学習: 演示分析の費用]
  • [RCSVデータ収集サービス]
  • [RCSVデータプラットフォーム]

RCSVインフラに関する最初の方針を訓練する

RCSVプラットフォームは,ACTと拡散政策の訓練設定,データセット管理,評価ツールなど,事前に構築されている.

[プラットフォームを探索]