返回VLA Models

传播政策与法案:选择哪个模仿学习算法?

<unk>比分扩散政策 (DDPM行动分量) 与ACT (CVAE变压器从移动ALOHA) <unk>多模式捕获,数据需求,推断速度,双手动适应.

现代机器人最广泛使用的模仿学习算法之一是基于断传播,另一个是基于移动ALOHA项目的CVAE变压器.

更新于2026年4月 动作零碎 MIT授权

T0) [收集示范数据]

TL;DR 散政策通过DDPM模拟了专家行动的多模式分布,在示范显示执行任务的"多种有效方法"时,它将金标准. ACT (Action Chunking Transformer) 来自移动ALOHA使用CVAE变压器,该变压器预测未来行动的部分,以学习的隐形死简单,快速列车,并使用双手机电话数据. 散政策在多模式强度上获胜;ACT在简单度,训练速度和双手动适应上获胜.

为什么这次比较很重要

当你收集自己的电话演示时, 在 [OpenArm]T2, [ALOHA]T3,或 [Unitree G1]T4) 你会训练或扩散政策或ACT, 这两个架构定义了纯模仿学习的现行默认标准:两者都使用动作分量,两者均获得MIT许可,两者都在 [LeRobot]T5中具有参考实现,并且两者都经常被引用为20242026机器人学习论文的基线.

它们有很不同的诱导偏见.如果你选择错误的偏见,你的政策将崩到中 (坏) 或记住演示 (也是坏).

一眼对比

Dimension Diffusion Policy ACT (Action Chunking Transformer)
Origin Chi et al., Columbia, RSS 2023 Zhao et al., Stanford (Mobile ALOHA), RSS 2023
Architecture CNN or transformer backbone + conditional diffusion (DDPM) action head ResNet visual encoder + transformer encoder-decoder with CVAE latent
Action representation Chunk of future actions denoised from Gaussian noise Chunk of future actions decoded autoregressively (or in parallel)
Training objective Denoising score matching / DDPM loss Reconstruction + KL regularizer (CVAE)
Typical chunk size 8–16 steps 50–100 steps (aggressive chunking)
Multi-modal capture Strong — native to the diffusion formulation Partial — latent captures some multi-modality but can mode-collapse
Data needed ~50–200 demos for narrow tasks; more helps ~50 demos often enough for bimanual teleop tasks
Training time Slower (diffusion steps increase wall-clock) Fast — minutes to hours on a single GPU
Inference speed Needs iterative denoising; DDIM or consistency models help Fast single forward pass; chunked execution amortizes
Best-known wins Push-T, real-world manipulation with multi-modal demos (+46.9% vs prior methods) Mobile ALOHA bimanual tasks, dexterous bimanual manipulation
License MIT MIT
Code github.com/real-stanford/diffusion_policy github.com/tonyzhaozh/act

扩散政策:调制分布模式,而不是平均值

传播政策的见解是,专家示范几乎总是多模式的.一个抓住杯子的人类电话运营商可能在不同的试验中使用侧抓或顶抓;基于这些数据训练的经典的MSE或跨性政策将平均两者,而不会产生任何一种. 扩散政策通过测试扩散概率模型 (DDPM) 模型来避免这一情况.在推断时,您采样一个噪音向量,并反复将其测试成基于视觉观测的行动部分.

[原始的散政策论文]T6) 在15项任务中报告了比以前最好的模仿学习方法平均改善46.9%,并且该架构成为下游工作的后台骨干,如[Octo]T7) 和3D散政策.成本是推断:一个天真的实现每块运行K散步骤,这可以推控制循环到10Hz以下. 大多数生产部署使用DDIM510步骤,或一致性蒸的变体,以获得实时控制.

当传播政策明亮时

  • 示范包含多种有效的策略 (抓获类型,方法指导,交出变化).
  • 接触式操纵,其中小动作扰乱的化合物 见 [接触式操纵指南]T8).
  • 你关心了对 perturbations 的强度,并且有预算来反复否定推理.
  • 你希望政策以更多的数据进行扩展,而不是平稳.

简单的变压器窃取了双手的冠冕

ACT与Mobile ALOHA和ALOHA双手机硬件一起作为参考模仿学习堆引入.架构是故意简单的:ResNet编码每个摄像头视图,变压器编码器将它们与自觉感合并,变压器解码器输出了50100个未来操作,根据学习的CVAE隐形. 在推断时,你将通过时间组合执行部分 (平均重叠预测),

通过预测远方的行动,它避免了逐步模仿学习的经典"复合错误".通过组合重叠的块,它平均产生高频噪音. 结果:在双手机远程任务 (杯堆,链,电池插入) 上,ACT经常成功地进行50次示范,而标准行为克隆基线则需要数千次.ACT是默认的 (ALOHA平台的启动政策) T9),LeRobot框架运行了正规的ACT实现.

当 ACT 亮相时

  • 两手机远程操作数据 ACT是为此设计的,
  • 你需要快速训练,反复设计任务,而不是等待扩散融合.
  • 控制频率是重要的,你不想在循环中反复拒绝.
  • 演示活动相对一致 (单一优先战略).

数据要求

根据现代VLA标准,这两种架构都能节省数据效率. 您正在从零开始训练一个狭窄的任务,而不是细节调整7B模型. 在实践中,50次示范将使ACT在双手操作任务上获得合理的成功率,而扩散政策通常需要100200次示范,以匹配ACT在多模式任务上 (然后作为示范规模超过它). 如果您还没有收集数据, [RCSV的电话运行服务]T10) 捕捉了两架架构都预期的2050Hz双手录音,

推进和部署

ACT的单向传递使其成为更容易的部署目标. 随时组装的零件执行在笔记本电脑GPU上舒适地运行在3050Hz. 扩散政策的反复代号是最困难的案例,但社区已经与DDIM相结合,510步骤或一致性蒸变体,这使其达到竞争频率. 如果您使用边缘设备,请倾向于ACT;如果您使用4090或更好的工作站,则可以.

诚实的交易

对于真正多模式示范的任务,ACT的CVAE可以调整到平均战略,产生拙或不决定性的行为. 扩散政策的分布式建模处理这件优雅,但增加了推断复杂性和训练时间. 您可以随时与另一个人重新训练,如果第一次通过失败.

它们不会像基础VLA那样在实施中普遍化.如果你需要跨机器人转移,将其中一个与 [OpenVLA]T12) 或 [Octo]T13) 结合起来,并使用ACT/Diffusion Policy作为实施特定的行动头.

需要咨询的基准

两种架构都出现在[LIBERO]T14) 和Push-T/Robomimic套件中.

实际重要的实施细节

两种算法都比大多数VLA论文更简单,但决定成功或失败的细节往往会被抽象化丢失. 对于**散政策**,最常见的三大陷是: (1) 低训练指标者团队在经常需要200K时停止50K步骤, (2) 误调操作正常化,特别是当操作包括位置和抓住器位,以及 (3) 不使用EMA权重推断.

对于ACT**,关键键键是零件长度和时间组合增长.短的零件 (低于20步) 使ACT像尼拉行为克隆一样行为,并重新引入组合错误.非常长的零件 (超过200) 使政策易受扰乱. 调低只有当你看到动或升高只有当你看到长视线漂移.

结合两者与基础VLA

2026年,越来越多的生产堆不选择_only_ACT或_only_diffusion policy ,他们使用一个作为基础VLA背后的低级行动头.模式:像 [OpenVLA]T16) 这样的VLA将自然语言指令分析成一个现场意识的子目标,而ACT或diffusion Policy的头执行细节运动. 这就是2025年最具表现力的CALVIN和LIBERO提交的结构,反映了该领域的劳动分工:语言和抽象的基础模型,

成本和工程工作

根据现代标准,这两种算法都不昂贵.单个24GB的GPU (RTX 4090或A6000) 将在50个示例数据集上训练ACT或Diffusion Policy在不到一天内.ACT通常在墙钟术语中更快地融合,因为每个步骤都是单个变压器向前向后;Diffusion Policy的多步骤损失更重,但在较少的时代中融合. 预计412小时的总培训时间,以实现一个狭窄任务的合理政策,但注意的是,数据收集和策划需要比培训本身要长得多.

我们的建议

对于双手机电话任务,特别是 [ALOHA]T17) 或 G1 类型的硬件,开始使用 ACT.您将在下午运行,并且基本线很难以击败50个演示.对于单臂操纵,使用各种示范或接触丰富的任务,请从 Diffusion Policy开始. 它们是足够便宜的,以运行并行,看到两者都成功或两者都失败告诉你关于你的数据集的重要东西.

相关阅读 OpenVLA vs Octo → RT-X vs OpenVLA → 最佳VLA模型2026 → 扩散政策模型页面 → ALOHA数据集 → Teleop数据收集 →

任何VLA都能根据自己的演示进行调整.

收集演示片 → 运行它的硬件 → 评分一个政策 →