传播政策与法案:选择哪个模仿学习算法?
<unk>比分扩散政策 (DDPM行动分量) 与ACT (CVAE变压器从移动ALOHA) <unk>多模式捕获,数据需求,推断速度,双手动适应.
现代机器人最广泛使用的模仿学习算法之一是基于
更新于2026年4月 动作零碎 MIT授权
TL;DR
为什么这次比较很重要
当你收集自己的电话演示时, 在 [OpenArm]
它们有很不同的诱导偏见.如果你选择错误的偏见,你的政策将崩
一眼对比
| Dimension | Diffusion Policy | ACT (Action Chunking Transformer) |
|---|---|---|
| Origin | Chi et al., Columbia, RSS 2023 | Zhao et al., Stanford (Mobile ALOHA), RSS 2023 |
| Architecture | CNN or transformer backbone + conditional diffusion (DDPM) action head | ResNet visual encoder + transformer encoder-decoder with CVAE latent |
| Action representation | Chunk of future actions denoised from Gaussian noise | Chunk of future actions decoded autoregressively (or in parallel) |
| Training objective | Denoising score matching / DDPM loss | Reconstruction + KL regularizer (CVAE) |
| Typical chunk size | 8–16 steps | 50–100 steps (aggressive chunking) |
| Multi-modal capture | Strong — native to the diffusion formulation | Partial — latent captures some multi-modality but can mode-collapse |
| Data needed | ~50–200 demos for narrow tasks; more helps | ~50 demos often enough for bimanual teleop tasks |
| Training time | Slower (diffusion steps increase wall-clock) | Fast — minutes to hours on a single GPU |
| Inference speed | Needs iterative denoising; DDIM or consistency models help | Fast single forward pass; chunked execution amortizes |
| Best-known wins | Push-T, real-world manipulation with multi-modal demos (+46.9% vs prior methods) | Mobile ALOHA bimanual tasks, dexterous bimanual manipulation |
| License | MIT | MIT |
| Code | github.com/real-stanford/diffusion_policy | github.com/tonyzhaozh/act |
扩散政策:调制分布模式,而不是平均值
传播政策的见解是,专家示范几乎总是多模式的.一个抓住杯子的人类电话运营商可能在不同的试验中使用侧抓或顶抓;基于这些数据训练的经典的MSE或跨
[原始的
当传播政策明亮时
- 示范包含多种有效的策略 (抓获类型,方法指导,交出变化).
- 接触式操纵,其中小动作扰乱的化合物
见 [接触式操纵指南] T8 ). - 你关心了对 perturbations 的强度,并且有预算来反复否定推理.
- 你希望政策以更多的数据进行扩展,而不是平稳.
简单的变压器窃取了双手的冠冕
ACT与Mobile ALOHA和ALOHA双手机硬件一起作为参考模仿学习堆
通过预测远方的行动,它避免了逐步模仿学习的经典"复合错误".通过组合重叠的块,它平均产生高频噪音. 结果:在双手机远程任务 (杯堆
当 ACT 亮相时
- 两手机远程操作数据
ACT是为此设计的, - 你需要快速训练,反复设计任务,而不是等待扩散融合.
- 控制频率是重要的,你不想在循环中反复拒绝.
- 演示活动相对一致 (单一优先战略).
数据要求
根据现代VLA标准,这两种架构都能节省数据效率. 您正在从零开始训练一个狭窄的任务,而不是细节调整7B模型. 在实践中,50次示范将使ACT在双手操作任务上获得合理的成功率,而扩散政策通常需要100
推进和部署
ACT的单向传递使其成为更容易的部署目标. 随时组装的零件执行在笔记本电脑GPU上舒适地运行在30
诚实的交易
对于真正多模式示范的任务,ACT的CVAE可以调整到平均战略,产生
它们不会像基础VLA那样在实施中普遍化.如果你需要跨机器人转移,将其中一个与 [OpenVLA]
需要咨询的基准
两种架构都出现在[LIBERO]
实际重要的实施细节
两种算法都比大多数VLA论文更简单,但决定成功或失败的细节往往会被抽象化丢失. 对于**
对于ACT**,关键键键是零件长度和时间组合增长.短的零件 (低于20步) 使ACT像
结合两者与基础VLA
2026年,越来越多的生产堆
成本和工程工作
根据现代标准,这两种算法都不昂贵.单个24GB的GPU (RTX 4090或A6000) 将在50个示例数据集上训练ACT或Diffusion Policy在不到一天内.ACT通常在墙钟术语中更快地融合,因为每个步骤都是单个变压器向前向后;Diffusion Policy的多步骤损失更重,但在较少的时代中融合. 预计4
我们的建议
对于双手机电话任务,特别是 [ALOHA]
相关阅读 OpenVLA vs Octo → RT-X vs OpenVLA → 最佳VLA模型2026 → 扩散政策模型页面 → ALOHA数据集 → Teleop数据收集 →
任何VLA都能根据自己的演示进行调整.







