返回Research

行动与传播政策:你应该使用哪个机器人学习算法? (2025)

对于机器人学习任务,可以选择与变化器的行动<unk>和传播政策的明确框架.

部分: [模仿学习指南]

T13)

对于研究人员和 ML 工程师来说,选择与变体的行动和模仿学习的传播政策的深入比较.

两个算法都从示范中学习 主要的区别是它们如何代表和生成行动

演示政策机器人

ACT (变形器的行动) 和扩散政策是2025年机器人操纵研究中最广泛使用的模仿学习算法. 选择它们之间不是一个普遍更好的问题,这取决于你的任务结构,数据预算,推断限制以及你能吸收的实施复杂性.

什么是ACT (变形器的动作)?

ACT由斯坦福大学的托尼·等人在"低成本硬件学习双手操作" (RSS 2023) 论文中介绍.关键见解是行动分量:而不是一次性预测一个行动,政策预测了未来行动的短序列一分量 (通常是50100个时间步骤在50Hz). 这减少了有效决策频率,并减轻了单步预测的复合错误.

ACT采用CVAE (条件变动自动编码器) 架构.在训练期间,编码器将完整的示范行动序列映射到一种隐藏的风格T3.一个变压器解码器然后预测根据当前的图像观测和T4的行动部分.在推断时,从前面 (一个加斯单元) 抽取了样本. 时间组合 平均重叠的部分预测 进一步使执行顺利.

建筑一眼

  • 背骨: ResNet-18或 ResNet-50用于图像编码;标准变压器编码器-解码器
  • ** 动作表示:** 连续关节位置,预测为长度_k_ (默认:100在50Hz=2秒)
  • 损失: L1 逆转在行动块上 + KL 异差在模特隐藏
  • **传输速度:**快速 单一向前传输产生了全片;有效控制在50Hz的部分重复使用
  • 参数: ~85M (ACT与ResNet-50+变压器)

传播政策是什么?

散政策是由哥伦比亚特工大学和MIT的Chi等人在"散政策:通过行动散学习视觉动力政策" (RSS 2023) 中引入的.它将机器人政策学习作为一种条件性散过程重新构成.在培训时,噪音逐渐加入专家行动序列. 模型 U-Net或变压器学会扭转这一过程:鉴于噪音的行动和当前的观察,预测清洁行动.

在推断时,从高斯噪音开始,并反复测试 _T_步骤 (通常是DDPM的10100步骤或DDIM加速的110步骤).这在每个调用时产生了完整的行动预测视界 (通常是816步骤). 传播过程的多模式性质意味着该政策可以代表从同一观察中完成任务的多种有效方法.

传播政策结构一眼

  • 背骨: CNN 图像编码器;噪声预测网络是通过动作序列或变压器 (DiT式) 的U-Net
  • 行动表示: 持续的联合位置或终端效应物,在预测视野上_H_ (通常是816步)
  • 损失: 否定分数匹配 (噪音预测的MSE)
  • ** 推理速度:** 比 ACT 慢 需要每次行动查询的步骤指标;DDIM显著减少这一点 (10步推理实践)
  • 参数: ~70300M,取决于脊柱选择

面对面的比较

Dimension ACT Diffusion Policy
Core mechanism CVAE + transformer, predicts action chunk directly Conditional denoising diffusion over action horizon
Multimodal action distributions Limited — CVAE latent provides some coverage but collapses on complex distributions Excellent — diffusion naturally represents multimodal distributions
Data efficiency High — works well with 50–200 demos Moderate — typically needs 100–500 demos; benefits more from scale
Inference speed Fast — single forward pass, chunk reuse; ~5ms/query on A100 Slower — 10–100 denoising steps; ~50–200ms with DDPM, ~15ms with DDIM on A100
Real-time control Excellent — designed for 50 Hz with temporal ensemble Feasible with DDIM + action horizon receding; requires tuning
Task types where it wins Bimanual manipulation, ALOHA-style tasks, precise assembly, long-horizon tasks with clear structure Dexterous grasping, contact-rich tasks, tasks with multiple valid execution modes
Hardware requirements Single GPU (RTX 3090 sufficient); ~8GB VRAM for inference Single GPU; DDPM needs ~16GB, DDIM feasible on RTX 3090; more latency-sensitive
Implementation complexity Moderate — well-documented, LeRobot reference implementation Higher — denoising schedule tuning, inference step count tradeoffs
Training time (100 demos) ~4–8 hours on a single RTX 4090 ~6–12 hours on a single RTX 4090
Hyperparameter sensitivity Moderate — chunk size and KL weight matter High — noise schedule, diffusion steps, and horizon are all critical
Open-source maturity Very high — original codebase + LeRobot High — original codebase + LeRobot + multiple reproductions

基准号码

下列数字来自论文和可复制性研究报告的结果.任务成功率与演示质量,摄像头设置和机器人校准相差异显著.

利比罗基准 (Chi et al. 复制, 2024)

Suite ACT Success Rate Diffusion Policy Success Rate
LIBERO-Spatial (10 tasks) 84.7% 78.2%
LIBERO-Object (10 tasks) 90.1% 82.4%
LIBERO-Goal (10 tasks) 71.6% 68.9%
LIBERO-Long (10 tasks) 53.8% 48.1%

和其他工作人员 (原始 ACT 论文, Zhao et al. 2023)

Task ACT (50 demos) BC-Transformer (50 demos) Diffusion Policy (50 demos)
Slot insertion 62% 24% 38%
Cup unstacking 98% 72% 84%
Bag transfer 100% 44% 58%

博 (博) 公司

在多模式的行动分布 (例如从多个有效的方法方向中选择) 的任务上, 扩散政策显示出与标准ACT等回归政策相比强大的优势: +1525%的成功率在"按"和"开放抽"等任务上,方法角度模糊. 染政策采样模式,并承诺.

什么时候选择行动

  • 双手操作: ACT 设计用于ALOHA双手设置,并且在同步的双手协调上卓越.
  • 精确的组装任务: 插,盖子插,插插. 碎片机器减少组合定位错误.
  • 低的演示预算: 如果您的演示量少于100次,ACT通常会更可靠地融合.
  • 速度敏感部署: 如果您需要在适度硬件上运行50 Hz (例如,本地工作站GPU),ACT的单通推理比DDPM扩散要更容易处理.
  • ** 长任务,结构清晰:** ACT的2秒段很适合分成阶段 (到达,抓住,位置) 的任务,每个阶段的阶段间差异低.

什么时候选择传播政策

  • **接触不确定性的外层操纵:**当接近角,抓取方向或指部放置有多个有效选择时,扩散自然代表了完整的分布.
  • ** 具有模糊的专家演示的任务:** 如果您的远程操作数据包含了多个不同的战略,相同的任务开始状态,
  • **高DoF精巧的手:**指纹轨迹规划具有高本质的多模性.
  • 规模较大的数据预算: 扩散政策的性能与数据集规模相比较好,因为拒绝目标不会像CVAE KL规范化一样破坏表现.
  • **国家 (非视觉) 政策:**当从自主感受状态运行时,U-Net的传播政策的脊柱特别有效和精确研究.

两手工案:ACT获胜

对于双手操作,ALOHA,DK1等平台所定义的任务类具有系统优势.该行动部分直接在预测目标中编码左臂和右臂操作之间的时间关系. 机器人执行了整个部分,这意味着协调是"入"预测轨迹而不是从两个单独要求的政策中出现.

扩散政策可以通过连接两臂操作空间来适应双手使用,但增加的维度使得揭示问题变得更加困难,数据需求大幅增加.实际上,两手研究的实验室 (斯坦福 ALOHA 组,UMass,CMU) 为此原因默认使用ACT或ACT+变体.

执行:勒罗伯特代码片段

两个算法都可用在 [HuggingFace LeRobot]T14. 下面是最低训练调用.

训练ACT与LeRobot

python lerobot/scripts/train.py \
  policy=act \
  env=aloha \
  dataset_repo_id=lerobot/aloha_sim_insertion_human \
  hydra.run.dir=outputs/train/act_insertion \
  training.num_workers=4 \
  training.batch_size=8 \
  training.num_epochs=2000 \
  policy.chunk_size=100 \
  policy.n_action_steps=100 \
  policy.temporal_ensemble_momentum=0.01

关键 ACT 超参数调节:

  • T6:每次前进传输预测的时间步骤数.50Hz时默认100 = 2秒.为更快的任务减少到50秒.
  • T7:控制重叠的块如何被混合. 低 = 滑,但更落后.
  • T8:CVAE KL术语的重量.默认10.0.如果政策模式在简单任务上崩,增加.

培训与勒罗伯特的传播政策

python lerobot/scripts/train.py \
  policy=diffusion \
  env=pusht \
  dataset_repo_id=lerobot/pusht \
  hydra.run.dir=outputs/train/diffusion_pusht \
  training.num_workers=4 \
  training.batch_size=64 \
  training.num_epochs=2000 \
  policy.n_action_steps=8 \
  policy.horizon=16 \
  policy.num_inference_steps=100 \
  policy.num_train_timesteps=100

调节的关键扩散政策超参数:

  • T9:DDIM指导推断步骤.默认100 (DDPM).设置为1020用于实时使用 (DDIM计划器).
  • T10:全预测窗口.高 = 流的轨迹;低 = 反应更强.16是表顶任务的良好起点.
  • T11:在重新查询之前从视界执行多少操作.通常是视界/2.

时间表之间转换 (DDPM与DDIM)

# In your config or Python override:
# Use DDIM for fast inference (10 steps instead of 100)
policy.noise_scheduler._target_=diffusers.DDIMScheduler
policy.num_inference_steps=10

# DDIM produces near-identical quality at 10x faster inference
# Benchmark: 100-step DDPM ~180ms → 10-step DDIM ~18ms on RTX 3090

ACT+ 和值得了解的变体

ACT+ (来自"ALOHA Unleashed"论文,2024) 通过额外的训练技巧扩展了ACT:更大的ResNet脊柱,更好的数据增强和联合位置+速度目标.它在相同的ALOHA任务上实现了比尼拉ACT高达15%的成功率.如果你使用ALOHA或DK1硬件开始一个新项目,则更喜欢ACT+而不是尼拉ACT.

** 散政策变压器 (DP-T) **将U-Net噪声预测器取代为变压器,使得更好的长距离时间建模和扩展.在复杂任务 (30+第二集) 上,DP-T比基于CNN的变体优于~8%的成功率,但需要更多的计算和数据.

总结:决策树

按照此决定过程:

  1. 如果双手操作 → ACT (或 ACT+)
  2. 如果在100个演示中
  3. 如果需要 <10ms推断** → ACT
  4. 如果任务具有多模式的行动分布** (多个有效的抓住,接近角) → 扩散政策
  5. 如果的手控制 (5+指 DoF) → 扩散政策
  6. 如果**大数据集 (>500个演示)**和扩展 → 传播政策
  7. 如果不确定 → 训练两者都在50个试点试点分开和比较;预算~2天的计算

收集数据的考虑

对于任何算法来说,示范质量比较重要的是小型数据模式 (<200个演示).一致的远程操作速度,流轨迹和良好的摄像头覆盖率占主导地位.我们提供[数据收集服务]T15) 远程操作,HDF5/LeRobot格式化,QA ,为那些想在没有构建完整的收集管道的情况下快速进行反复的团队提供.

对于硬件:ACT 设计在ALOHA (低成本双手册) 周围. 扩散政策是硬件不知己的. 两者都运行在OpenArm 1和DK1上 LeRobot SDK.

ACT模型页面 → 分散政策模型页面 → VLA模型比较 →

读到评估是一件事 证明实用硬件的政策是另一件事.

运行现实世界评估 → 委员会评估数据 → 你的评估设备的硬件 →