行为与传播政策:选择正确算法的实用指南
什么时候使用变压器 (ACT) 与传播政策的行动<unk>缩机器人操纵 <unk>延迟,任务复杂性和训练数据交易.
部分: [模仿学习指南]
算法选择比数据质量更重要,但它足以让我们做得正确.
简单的摘要
ACT (Action Chunking with Transformers, Zhao et al. 2023) 使用CVAE来生成一次预测的20-100次未来行动的动作块
推理延迟:实际的限制
对于实时机器人控制,推断延迟是一个难以置信的限制,它通常在任何其他考虑之前决定算法选择.
| Algorithm | Inference Time | Control Hz | Notes |
|---|---|---|---|
| ACT | 50 ms | 20 Hz | Executes 20-step chunks; real inference rate much lower |
| Diffusion Policy (DDPM) | 500 ms | 2 Hz | Too slow for reactive tasks without chunking |
| Diffusion Policy (DDIM 10 steps) | 200 ms | 5 Hz | Acceptable for slow manipulation |
| Consistency Policy | 50 ms | 20 Hz | Single denoising step; matches ACT latency |
| ACT + temporal ensemble | 50 ms | 20 Hz | Smoothing across multiple chunk predictions |
如果您的任务需要反应高频控制 (捕捉,倒,高速组装),标准的扩散政策DDPM只是太慢.使用ACT或一致性政策.如果您的任务涉及慢,精确的操纵,200ms延迟是可接受的,DDIM扩散政策是可行的,可能会产生更好的结果.
任务类型的建议
- 快速反应任务 (捕捉,
动,高速选择): ACT或一致性政策. 20Hz 控制速度允许实时调整. 2Hz 的扩散DPM不能响应移动物体. - 可行的多种解决方案 (插孔,USB插入,布料折叠): 扩散政策.其明确的多种模式使其能够模拟分布在成功的抓取策略上,而不是仅仅是平均
,对于平均策略经常失败的精度任务至关重要. - 长
任务超过10步骤: 单独的算法都不够. 使用层次性政策:任务规划器选择子任务序列,然后ACT或扩散政策执行单个子任务. - 物体位置有很大的不同之处的任务: 两者都能工作,但在训练有足够的数据时,分散政策往往更好地将物体位置概括为新物体位置.
培训数据要求
| Algorithm | Minimum Demos | Recommended | Training Time (single GPU) |
|---|---|---|---|
| ACT | 50 | 100–500 | 2–4 hours |
| Diffusion Policy (DDPM) | 200 | 500–2000 | 6–12 hours |
| Consistency Policy | 100 | 300–1000 | 4–8 hours |
对于新任务探索,ACT的数据需求较低是真正的优势,在收集500多个演示程序时,收集成本很高.然而,在更多数据可用时,Difusion Policy经常赶上并超过ACT. 特别是对于精密任务.
超参数敏感度
对于 ACT 的关键超值,是CVAE损失的KL差距重量.太低:隐藏空间崩
扩散政策对学习速度时间表和噪音差异时间表更敏感.最初的DDPM实施使用了线性加热 LR的可西因噪音时间表;这些默认在实践中很好工作.最常见的错误是使用过高的学习速度 (>3e-4与亚当),这导致了接触丰富的数据上的训练不稳定.
决策矩阵
| Condition | Recommended Algorithm |
|---|---|
| < 200 demos available | ACT |
| Reactive/high-speed task | ACT or Consistency Policy |
| 精度 with multi-modal solutions | Diffusion Policy |
| > 500 demos, slow task | Diffusion Policy |
| Deployment on low-compute hardware | ACT (lighter model) |
| Want to use HuggingFace LeRobot | Both supported |
两个算法都可用于RCSV [数据平台]
在帽子下:ACT建筑
通过 ACT (变体的动作分组) 将CVAE (条件变量自动编码器) 与变体架构结合在一起,以预测动作分组 - - 从单个观察中进行20-100次未来的行动的序列.
**编码器:**视觉编码器通过预训练的背骨 (通常是ResNet-18或ViT变体) 处理摄像头图像. 联合状态 (自觉感知) 与视觉特征相结合. 结合的观察被输送到一个转former编码器,产生了文本嵌入.
CVAE: 在训练过程中,CVAE编码器采用了基因真相行动序列和观察以产生一个隐藏变量z.在推理过程中,z从学习的先验中采样 (仅基于观察).隐藏z捕获了行动的"风格" - 不同的z样本产生不同的但有效的完成任务的策略. 测试时,在CVAE损失中,KL分离期限确保前和后分布保持接近,使得试验时可以从前进行样本取样.
**解码器:**变压器解码器采用了语境嵌入和隐藏的z,并自动降低生成行动部分.每个输出位置预测一个行动 (通常是7D:6D终端效应的三角形+1D抓住器).整个部分是通过单个前进传输生成的 (不像语言模型代币一样反复),这就是为什么ACT实现50ms推断.
** 时间组:** 在部署时,ACT在每次重观测步骤中生成重叠的行动块,并平均了重量指数 (最近的预测重量更大) 的重叠预测的行动. 这使得区块之间的过渡顺利,并减少了区块边界的动荡. 总体重量衰变参数 (通常是0.01) 控制了顺度和反应能力之间的权衡.
在帽子下:传播政策架构
扩散政策应用了DDPM (Denoising Diffusion Probabilistic Model) 框架来预测机器人行动.它不是从噪音中生成图像 (就像图像扩散模型一样),而是从噪音中生成行动序列.
前进过程: 在训练过程中,噪音逐渐增加到T扩散步骤上的地面真相行动序列中 (通常T=100对于DDPM).在T步骤,该行动是纯粹的高斯噪音.模型学习了逆转这个过程:鉴于t步骤的噪音行动和观察,直接预测增加的噪音 (epsilon预测) 或清洁行动.
网络架构: 标示网络可以是1DU-网 (
** 推理:** 从纯噪音开始,模型反复测试T步骤,以产生清洁的行动序列.DDPM使用T=100步骤 (慢).DDIM (测试
多模式性: 扩散政策与ACT的核心优势是明确的多模式行动分布建模.当任务具有多个有效的策略 (从左对右的方法,从上对侧的方法),则扩散模型可以代表学习分布中的所有有效模式. ACT的CVAE也可以通过隐形空间表示多种模式,但KL规律化往往在实践中崩
混合方法:将ACT与传播政策结合起来
两种算法的优势都结合了几种混合方法:
- **DP-T (分散政策变压器):**将U-Net的变压器取代,以行动序列长度和观察复杂性提高规模化.DP-T使用DDIM10步推理实现100ms延迟 (ACT和标准DP之间) 与多模式行动预测.这是有足够的计算的团队的默认选择.
- ** 连贯性政策:** 用连贯性训练将训练的
散性政策 化成单步生成器.结果与ACT的50ms推理相匹配,同时保留了 散性政策的多模式行动分布. - ACT多头预测: 代替单个CVAE解码器,使用K解码器头,每个头都预测不同的行动部分.在推理时,选择该预测部分与最近的观察相比具有最低的重建错误的头.这在ACT级推理速度提供了分离多模式 (K模式).实际K值为3-5.
- 下层式DP+ACT: 在低频率 (1-2Hz) 上使用高水平技能选择 (掌握战略,接近方向) 的扩散政策,以及在高频率 (20Hz) 上执行低水平轨迹的ACT. 这结合了DP的多模式规划和ACT的快速反应控制.
根据硬件平台的推理基准
部署硬件决定了哪个算法是可行的.这些基准使用标准模型尺寸 (ACT:ResNet-18背骨+4层变压器,~25M参数; 扩散政策:ResNet-18+1D U-Net,~55M参数; 一致性政策:与DP相同的架构,蒸
| Algorithm | RTX 4090 | RTX 3060 | Jetson Orin (64GB) | Jetson Orin Nano | Apple M2 (MPS) | CPU (i7-13700) |
|---|---|---|---|---|---|---|
| ACT (chunk=50) | 12 ms / 83 Hz | 35 ms / 28 Hz | 50 ms / 20 Hz | 120 ms / 8 Hz | 65 ms / 15 Hz | 180 ms / 5.5 Hz |
| ACT (chunk=100) | 18 ms / 55 Hz | 50 ms / 20 Hz | 75 ms / 13 Hz | 180 ms / 5.5 Hz | 95 ms / 10 Hz | 280 ms / 3.5 Hz |
| DP (DDPM, 100 steps) | 150 ms / 6.6 Hz | 420 ms / 2.4 Hz | 600 ms / 1.7 Hz | 1800 ms / 0.6 Hz | 550 ms / 1.8 Hz | 4200 ms / 0.2 Hz |
| DP (DDIM, 10 steps) | 22 ms / 45 Hz | 65 ms / 15 Hz | 100 ms / 10 Hz | 280 ms / 3.6 Hz | 85 ms / 12 Hz | 650 ms / 1.5 Hz |
| DP-T (DDIM, 10 steps) | 28 ms / 35 Hz | 80 ms / 12.5 Hz | 120 ms / 8 Hz | 350 ms / 2.9 Hz | 105 ms / 9.5 Hz | 820 ms / 1.2 Hz |
| Consistency Policy | 15 ms / 66 Hz | 45 ms / 22 Hz | 70 ms / 14 Hz | 200 ms / 5 Hz | 60 ms / 16 Hz | 350 ms / 2.9 Hz |
关键观察: 在桌面GPU以下任何东西上DDPM扩散政策是不可用的.在Jetson Orin上,DDIM带来了10步的DP (对于大多数操纵任务来说,10Hz足够).ACT是Jetson Orin Nano (8Hz与chunk=50) 上唯一以可接受速度运行的算法. 兼容性政策与ACT速度相匹配,同时保留DP的多模式性质,使其成为中端硬件的最佳选择 - - 如果你有资金负担更多的训练时间.
对于移动机器人 (RCSV的Unitree G1,Mobile ALOHA平台),Jetson Orin是标准计算模块.这意味着您的实际选择是ACT,DDIM DP或一致性政策.DDPM DP仅可通过网络连接的桌面GPU (增加5-15ms网络延迟,这对于缓慢任务是可接受的) 实现.
训练效率比较
培训成本取决于数据集大小,GPU硬件和算法.这些基准使用标准设置:2摄像头输入 (224x224),7DOF行动空间,单个NVIDIAGPU.
| Scenario | ACT (A100) | ACT (RTX 3060) | DP (A100) | DP (RTX 3060) | CP (A100) |
|---|---|---|---|---|---|
| 100 demos, 2K epochs | 45 min | 2.5 hr | 2 hr | 8 hr | 4 hr* |
| 500 demos, 2K epochs | 3 hr | 12 hr | 8 hr | 36 hr | 16 hr* |
| 2000 demos, 3K epochs | 18 hr | 72 hr | 48 hr | 8+ days | 96 hr* |
| Cloud cost estimate (above) | $35 | N/A (local) | $95 | N/A (local) | $190* |
对于相同数据集尺寸,ACT训练速度比扩散政策快3x,这在快速原型制作时很重要.当你重复数据收集策略和超参数时.典型的开发周期包括5-10次训练评估-收集重复,然后在工作政策上汇聚. 在当地RTX 3060上的500个演示,这相当于ACT的5-10天训练,而DP的15-30天.这本身就证明了开始从ACT开始进行初步任务探索,然后在数据收集完成后转向DP,你想要最大的性能.
任务级成功率比较
基于OpenArm 1+RealSense D435i的公布评估和RCSV内部基准的原始数字.所有政策都基于每个任务的相同示范数据集训练.成功 =在示范时间的2倍内完成的任务.
| Task | Demos | ACT | DP (DDIM) | CP | Winner |
|---|---|---|---|---|---|
| Pick cube (single position) | 50 | 92% | 85% | 88% | ACT |
| Pick cube (random position) | 200 | 78% | 84% | 82% | DP |
| Peg insertion (tight fit, 1mm) | 300 | 55% | 72% | 68% | DP |
| Bimanual handover | 200 | 75% | 70% | 72% | ACT |
| Cloth folding | 500 | 40% | 62% | 58% | DP |
| Pour liquid (speed-critical) | 150 | 68% | 52% | 65% | ACT |
| Stack 3 blocks (sequential) | 400 | 35% | 48% | 45% | DP |
模式: ACT在需要速度 (倾倒,传递) 和小数据集 (单位选用50个演示) 上获胜. DP在精度任务 (
常见的故障模式和调整
两个算法都以可预测的方式失败.识别失败模式告诉你,修复是否更多数据,不同的超参数,或者完全不同的算法.
特定的行为失败
- **模式平均 (接触附近的
动):**该政策平均两个有效的策略 (左对右的方法) 产生一个无处可行的轨迹. 修正:增加KL重量以鼓励模式承诺,或收集更多的示范,以一致使用一个策略.如果任务本质上需要多模式行为,请切换到 散策略. - ** 分片边界不连续性 (每 N 步骤突然
动):** 时间组在连续的分片之间不够平滑. 修复:减少组的重量衰减 (试用 0.005 而不是 0.01) 或增加分片重叠 (每10 步而不是每25 步重新预测). - 长时间任务 (>15秒): ACT没有明确的机制来纠正长视线积累的错误.该政策预测开放循环块慢慢偏离预期轨迹.修复:增加重观频率 (每5到10步一次再预测,而不是执行完整的部分),或在块之间增加闭环错误纠正.
传播政策的具体失败
- ** 缓慢反应对扰乱:** 随着100步DDPM,该政策不能对 500ms 时间内应对意外事件 (物体滑动,人类干预). 修正:切换到10步DDIM或一致性政策.对于反应性子任务,使用混合架构与ACT用于反应性组件.
- **训练崩
(损失峰值,NaN梯度):**通常发生在3e-4以上的学习率或32以下的批量量下. - 过度滑的轨迹 (
接器开/关闭太慢): 扩散接过程自然会平滑的作用分布,从而可以圆结 接器的 接器的过渡. 修复:在训练中增加DDPM步骤的数量 (试用200而不是100) 保持 接器的过渡,或后处理 接器的尺寸以门 (>0.5 =开,<0.5 =闭).
转换到 转换到 转换到 转换到 转换
对于边缘硬件部署,ACT和DP都从ONNX出口和TensorRT优化中得到了显著的好处.
导出ACT到ONNX为TensorRT导入火
训练技巧对两个算法
# Common training configuration patterns for LeRobot
# ACT config (lerobot/configs/policy/act.yaml)
# Key hyperparameters to tune:
# chunk_size: 50-100 (longer = smoother but less reactive)
# kl_weight: 10 (sweep: 1, 5, 10, 50)
# lr: 1e-4 (reduce to 5e-5 if training is unstable)
# batch_size: 32-64
# n_epochs: 2000 (for 200 demos; scale proportionally)
# Diffusion Policy config (lerobot/configs/policy/diffusion.yaml)
# Key hyperparameters:
# n_diffusion_steps: 100 (DDPM) or 10 (DDIM at inference)
# prediction_type: "epsilon" (noise prediction; more stable than "sample")
# lr: 1e-4 with cosine schedule
# batch_size: 64-128 (DP benefits from larger batches more than ACT)
# n_epochs: 3000 (for 200 demos; DP converges slower than ACT)
# Both algorithms:
# - Use action normalization (zero mean, unit variance per dimension)
# - Use image augmentation (random crop 84-96%, color jitter)
# - Monitor validation loss every 50 epochs; save best checkpoint
# - EMA (exponential moving average) of weights at 0.9999 decay
相关阅读
- [机器人模仿学习:从示范到部署]
- [LeRobot框架:开始指南]
- [机器人政策概括:为什么机器人在新物体上失败]
- [机器人学习的规模规则:2026年我们所知道的内容]
- [机器人学习:每次示范分析的成本]
- [RCSV数据收集服务]
- [RCSV数据平台]
培训您的第一项关于RCSV基础设施的政策
基于RCSV平台,可提供预先构建的ACT和传播政策培训配置,数据集管理和评估工具.







