行动与传播政策:你应该使用哪个机器人学习算法? (2025)
对于机器人学习任务,可以选择与变化器的行动<unk>和传播政策的明确框架.
部分: [模仿学习指南]
对于研究人员和 ML 工程师来说,选择与变体的行动
两个算法都从示范中学习
演示政策机器人
ACT (变形器的行动
什么是ACT (变形器的动作)?
ACT由斯坦福大学的托尼·
ACT采用CVAE (条件变动自动编码器) 架构.在训练期间,编码器将完整的示范行动序列映射到一种隐藏的风格
建筑一眼
- 背骨: ResNet-18或 ResNet-50用于图像编码;标准变压器编码器-解码器
- ** 动作表示:** 连续关节位置,预测为长度_k_ (默认:100在50Hz=2秒)
- 损失: L1 逆转在行动块上 + KL 异差在模特隐藏
- **传输速度:**快速
单一向前传输产生了全片;有效控制在50Hz的部分重复使用 - 参数: ~85M (ACT与ResNet-50+变压器)
传播政策是什么?
在推断时,从高斯噪音开始,并反复测试 _T_步骤 (通常是DDPM的10
传播政策结构一眼
- 背骨: CNN 图像编码器;噪声预测网络是通过动作序列或变压器 (DiT式) 的U-Net
- 行动表示: 持续的联合位置或终端效应物,在预测视野上_H_ (通常是8
16步) - 损失: 否定分数匹配 (噪音预测的MSE)
- ** 推理速度:** 比 ACT
慢 需要每次行动查询的步骤指标;DDIM显著减少这一点 (10步推理实践) - 参数: ~70
300M,取决于脊柱选择
面对面的比较
| Dimension | ACT | Diffusion Policy |
|---|---|---|
| Core mechanism | CVAE + transformer, predicts action chunk directly | Conditional denoising diffusion over action horizon |
| Multimodal action distributions | Limited — CVAE latent provides some coverage but collapses on complex distributions | Excellent — diffusion naturally represents multimodal distributions |
| Data efficiency | High — works well with 50–200 demos | Moderate — typically needs 100–500 demos; benefits more from scale |
| Inference speed | Fast — single forward pass, chunk reuse; ~5ms/query on A100 | Slower — 10–100 denoising steps; ~50–200ms with DDPM, ~15ms with DDIM on A100 |
| Real-time control | Excellent — designed for 50 Hz with temporal ensemble | Feasible with DDIM + action horizon receding; requires tuning |
| Task types where it wins | Bimanual manipulation, ALOHA-style tasks, precise assembly, long-horizon tasks with clear structure | Dexterous grasping, contact-rich tasks, tasks with multiple valid execution modes |
| Hardware requirements | Single GPU (RTX 3090 sufficient); ~8GB VRAM for inference | Single GPU; DDPM needs ~16GB, DDIM feasible on RTX 3090; more latency-sensitive |
| Implementation complexity | Moderate — well-documented, LeRobot reference implementation | Higher — denoising schedule tuning, inference step count tradeoffs |
| Training time (100 demos) | ~4–8 hours on a single RTX 4090 | ~6–12 hours on a single RTX 4090 |
| Hyperparameter sensitivity | Moderate — chunk size and KL weight matter | High — noise schedule, diffusion steps, and horizon are all critical |
| Open-source maturity | Very high — original codebase + LeRobot | High — original codebase + LeRobot + multiple reproductions |
基准号码
下列数字来自论文和可复制性研究报告的结果.任务成功率与演示质量,摄像头设置和机器人校准相差异显著.
利比罗基准 (Chi et al. 复制, 2024)
| Suite | ACT Success Rate | Diffusion Policy Success Rate |
|---|---|---|
| LIBERO-Spatial (10 tasks) | 84.7% | 78.2% |
| LIBERO-Object (10 tasks) | 90.1% | 82.4% |
| LIBERO-Goal (10 tasks) | 71.6% | 68.9% |
| LIBERO-Long (10 tasks) | 53.8% | 48.1% |
和其他工作人员 (原始 ACT 论文, Zhao et al. 2023)
| Task | ACT (50 demos) | BC-Transformer (50 demos) | Diffusion Policy (50 demos) |
|---|---|---|---|
| Slot insertion | 62% | 24% | 38% |
| Cup unstacking | 98% | 72% | 84% |
| Bag transfer | 100% | 44% | 58% |
博 (博) 公司
在多模式的行动分布 (例如从多个有效的方法方向中选择) 的任务上, 扩散政策显示出与标准ACT等回归政策相比强大的优势: +15
什么时候选择行动
- 双手操作: ACT 设计用于ALOHA双手设置,并且在同步的双手协调上卓越.
- 精确的组装任务:
插,盖子插,插插. 碎片机器减少组合定位错误. - 低的演示预算: 如果您的演示量少于100次,ACT通常会更可靠地融合.
- 速度敏感部署: 如果您需要在适度硬件上运行50 Hz (例如,本地工作站GPU),ACT的单通推理比DDPM扩散要更容易处理.
- ** 长
任务,结构清晰:** ACT的2秒段很适合分成阶段 (到达,抓住,位置) 的任务,每个阶段的阶段间差异低.
什么时候选择传播政策
- **接触不确定性的外层操纵:**当接近角,抓取方向或指部放置有多个有效选择时,扩散自然代表了完整的分布.
- ** 具有模糊的专家演示的任务:** 如果您的远程操作数据包含了多个不同的战略,相同的任务开始状态,
- **高DoF精巧的手:**指纹轨迹规划具有高本质的多模性.
- 规模较大的数据预算: 扩散政策的性能与数据集规模相比较好,因为拒绝目标不会像CVAE KL规范化一样破坏表现.
- **国家 (非视觉) 政策:**当从自主感受状态运行时,U-Net的传播政策的脊柱特别有效和精确研究.
两手工案:ACT获胜
对于双手操作,ALOHA,DK1等平台所定义的任务类具有系统优势.该行动部分直接在预测目标中编码左臂和右臂操作之间的时间关系. 机器人执行了整个部分,这意味着协调是"
扩散政策可以通过连接两臂操作空间来适应双手使用,但增加的维度使得揭示问题变得更加困难,数据需求大幅增加.实际上,两手研究的实验室 (斯坦福 ALOHA 组,UMass,CMU) 为此原因默认使用ACT或ACT+变体.
执行:勒罗伯特代码片段
两个算法都可用在 [HuggingFace LeRobot]
训练ACT与LeRobot
python lerobot/scripts/train.py \
policy=act \
env=aloha \
dataset_repo_id=lerobot/aloha_sim_insertion_human \
hydra.run.dir=outputs/train/act_insertion \
training.num_workers=4 \
training.batch_size=8 \
training.num_epochs=2000 \
policy.chunk_size=100 \
policy.n_action_steps=100 \
policy.temporal_ensemble_momentum=0.01
关键 ACT 超参数调节:
T6 :每次前进传输预测的时间步骤数.50Hz时默认100 = 2秒.为更快的任务减少到50秒. T7 :控制重叠的块如何被混合. 低 = 滑,但更落后. T8 :CVAE KL术语的重量.默认10.0.如果政策模式在简单任务上崩 ,增加.
培训与勒罗伯特的传播政策
python lerobot/scripts/train.py \
policy=diffusion \
env=pusht \
dataset_repo_id=lerobot/pusht \
hydra.run.dir=outputs/train/diffusion_pusht \
training.num_workers=4 \
training.batch_size=64 \
training.num_epochs=2000 \
policy.n_action_steps=8 \
policy.horizon=16 \
policy.num_inference_steps=100 \
policy.num_train_timesteps=100
调节的关键扩散政策超参数:
T9 :DDIM指导推断步骤.默认100 (DDPM).设置为10 20用于实时使用 (DDIM计划器). T10 :全预测窗口.高 = 流 的轨迹;低 = 反应更强.16是表顶任务的良好起点. T11 :在重新查询之前从视界执行多少操作.通常是视界/2.
时间表之间转换 (DDPM与DDIM)
# In your config or Python override:
# Use DDIM for fast inference (10 steps instead of 100)
policy.noise_scheduler._target_=diffusers.DDIMScheduler
policy.num_inference_steps=10
# DDIM produces near-identical quality at 10x faster inference
# Benchmark: 100-step DDPM ~180ms → 10-step DDIM ~18ms on RTX 3090
ACT+ 和值得了解的变体
ACT+ (来自"ALOHA Unleashed"论文,2024) 通过额外的训练技巧扩展了ACT:更大的ResNet脊柱,更好的数据增强和联合位置+速度目标.它在相同的ALOHA任务上实现了比
**
总结:决策树
按照此决定过程:
- 如果双手操作 → ACT (或 ACT+)
- 如果在100个演示中
- 如果需要 <10ms推断** → ACT
- 如果任务具有多模式的行动分布** (多个有效的抓住,接近角) → 扩散政策
- 如果光
的手控制 (5+指 DoF) → 扩散政策 - 如果**大数据集 (>500个演示)**和扩展 → 传播政策
- 如果不确定 → 训练两者都在50个试点试点分开和比较;预算~2天的计算
收集数据的考虑
对于任何算法来说,示范质量比较重要的是小型数据模式 (<200个演示).一致的远程操作速度,流
对于硬件:ACT 设计在ALOHA (低成本双手册) 周围. 扩散政策是硬件不知己的. 两者都运行在OpenArm 1和DK1上 LeRobot SDK.
ACT模型页面 → 分散政策模型页面 → VLA模型比较 →
读到评估是一件事 证明实用硬件的政策是另一件事.







