返回Blog

行为与传播政策:选择正确算法的实用指南

什么时候使用变压器 (ACT) 与传播政策的行动<unk>缩机器人操纵 <unk>延迟,任务复杂性和训练数据交易.

部分: [模仿学习指南]

T2)

算法选择比数据质量更重要,但它足以让我们做得正确.

简单的摘要

ACT (Action Chunking with Transformers, Zhao et al. 2023) 使用CVAE来生成一次预测的20-100次未来行动的动作块序列.它快速 (50ms推断在单个GPU上),根据隐藏样本确定性,并且与50-500次示范很好. Diffusion Policy (Chi et al. 2023) 使用条件的指散模型在动作空间上. 它更慢 (200-500ms与DDPM,50ms与一致性蒸),显然多模式,并更好地处理精度任务和多步骤任务,更多数据.

推理延迟:实际的限制

对于实时机器人控制,推断延迟是一个难以置信的限制,它通常在任何其他考虑之前决定算法选择.

Algorithm Inference Time Control Hz Notes
ACT 50 ms 20 Hz Executes 20-step chunks; real inference rate much lower
Diffusion Policy (DDPM) 500 ms 2 Hz Too slow for reactive tasks without chunking
Diffusion Policy (DDIM 10 steps) 200 ms 5 Hz Acceptable for slow manipulation
Consistency Policy 50 ms 20 Hz Single denoising step; matches ACT latency
ACT + temporal ensemble 50 ms 20 Hz Smoothing across multiple chunk predictions

如果您的任务需要反应高频控制 (捕捉,倒,高速组装),标准的扩散政策DDPM只是太慢.使用ACT或一致性政策.如果您的任务涉及慢,精确的操纵,200ms延迟是可接受的,DDIM扩散政策是可行的,可能会产生更好的结果.

任务类型的建议

  • 快速反应任务 (捕捉,动,高速选择): ACT或一致性政策. 20Hz 控制速度允许实时调整. 2Hz 的扩散DPM不能响应移动物体.
  • 可行的多种解决方案 (插孔,USB插入,布料折叠): 扩散政策.其明确的多种模式使其能够模拟分布在成功的抓取策略上,而不是仅仅是平均,对于平均策略经常失败的精度任务至关重要.
  • 任务超过10步骤: 单独的算法都不够. 使用层次性政策:任务规划器选择子任务序列,然后ACT或扩散政策执行单个子任务.
  • 物体位置有很大的不同之处的任务: 两者都能工作,但在训练有足够的数据时,分散政策往往更好地将物体位置概括为新物体位置.

培训数据要求

Algorithm Minimum Demos Recommended Training Time (single GPU)
ACT 50 100–500 2–4 hours
Diffusion Policy (DDPM) 200 500–2000 6–12 hours
Consistency Policy 100 300–1000 4–8 hours

对于新任务探索,ACT的数据需求较低是真正的优势,在收集500多个演示程序时,收集成本很高.然而,在更多数据可用时,Difusion Policy经常赶上并超过ACT. 特别是对于精密任务.

超参数敏感度

对于 ACT 的关键超值,是CVAE损失的KL差距重量.太低:隐藏空间崩,政策忽略了文本.太高:政策忽略了示范,退向了平均值.标准建议:从10开始,在完整训练之前扫一扫1,5,10,50的小数据集.

扩散政策对学习速度时间表和噪音差异时间表更敏感.最初的DDPM实施使用了线性加热 LR的可西因噪音时间表;这些默认在实践中很好工作.最常见的错误是使用过高的学习速度 (>3e-4与亚当),这导致了接触丰富的数据上的训练不稳定.

决策矩阵

Condition Recommended Algorithm
< 200 demos available ACT
Reactive/high-speed task ACT or Consistency Policy
精度 with multi-modal solutions Diffusion Policy
> 500 demos, slow task Diffusion Policy
Deployment on low-compute hardware ACT (lighter model)
Want to use HuggingFace LeRobot Both supported

两个算法都可用于RCSV [数据平台]T3中的参考实现,并为OpenArm 1和常见的相机设置提供预先构建的培训配置.

在帽子下:ACT建筑

通过 ACT (变体的动作分组) 将CVAE (条件变量自动编码器) 与变体架构结合在一起,以预测动作分组 - - 从单个观察中进行20-100次未来的行动的序列.

**编码器:**视觉编码器通过预训练的背骨 (通常是ResNet-18或ViT变体) 处理摄像头图像. 联合状态 (自觉感知) 与视觉特征相结合. 结合的观察被输送到一个转former编码器,产生了文本嵌入.

CVAE: 在训练过程中,CVAE编码器采用了基因真相行动序列和观察以产生一个隐藏变量z.在推理过程中,z从学习的先验中采样 (仅基于观察).隐藏z捕获了行动的"风格" - 不同的z样本产生不同的但有效的完成任务的策略. 测试时,在CVAE损失中,KL分离期限确保前和后分布保持接近,使得试验时可以从前进行样本取样.

**解码器:**变压器解码器采用了语境嵌入和隐藏的z,并自动降低生成行动部分.每个输出位置预测一个行动 (通常是7D:6D终端效应的三角形+1D抓住器).整个部分是通过单个前进传输生成的 (不像语言模型代币一样反复),这就是为什么ACT实现50ms推断.

** 时间组:** 在部署时,ACT在每次重观测步骤中生成重叠的行动块,并平均了重量指数 (最近的预测重量更大) 的重叠预测的行动. 这使得区块之间的过渡顺利,并减少了区块边界的动荡. 总体重量衰变参数 (通常是0.01) 控制了顺度和反应能力之间的权衡.

在帽子下:传播政策架构

扩散政策应用了DDPM (Denoising Diffusion Probabilistic Model) 框架来预测机器人行动.它不是从噪音中生成图像 (就像图像扩散模型一样),而是从噪音中生成行动序列.

前进过程: 在训练过程中,噪音逐渐增加到T扩散步骤上的地面真相行动序列中 (通常T=100对于DDPM).在T步骤,该行动是纯粹的高斯噪音.模型学习了逆转这个过程:鉴于t步骤的噪音行动和观察,直接预测增加的噪音 (epsilon预测) 或清洁行动.

网络架构: 标示网络可以是1DU-网 (缩式,运行行动序列的时间维度) 或变压器.U-网变体是原始和最受测试的变压器变体 (DP-T,扩散政策变压器) 由于其更好的扩展性能,正在获得采用. 两者都以输入方式进行:噪音的行动序列,扩散时间步骤t (编码为一个鼻状嵌入式),以及视觉脊椎的观测编码.

** 推理:** 从纯噪音开始,模型反复测试T步骤,以产生清洁的行动序列.DDPM使用T=100步骤 (慢).DDIM (测试散隐含模型) 减少到10-20步骤,质量损失最小. 连贯蒸使整个消化过程被缩小到一个步骤,以付出额外的训练复杂性,与ACT的推断速度相匹配.

多模式性: 扩散政策与ACT的核心优势是明确的多模式行动分布建模.当任务具有多个有效的策略 (从左对右的方法,从上对侧的方法),则扩散模型可以代表学习分布中的所有有效模式. ACT的CVAE也可以通过隐形空间表示多种模式,但KL规律化往往在实践中崩模式,特别是与有限的训练数据. 扩散政策更可靠地保护模式,因为脱过程可以从不同噪音初始化 konverge到不同的模式.

混合方法:将ACT与传播政策结合起来

两种算法的优势都结合了几种混合方法:

  • **DP-T (分散政策变压器):**将U-Net的变压器取代,以行动序列长度和观察复杂性提高规模化.DP-T使用DDIM10步推理实现100ms延迟 (ACT和标准DP之间) 与多模式行动预测.这是有足够的计算的团队的默认选择.
  • ** 连贯性政策:** 用连贯性训练将训练的散性政策化成单步生成器.结果与ACT的50ms推理相匹配,同时保留了散性政策的多模式行动分布.
  • ACT多头预测: 代替单个CVAE解码器,使用K解码器头,每个头都预测不同的行动部分.在推理时,选择该预测部分与最近的观察相比具有最低的重建错误的头.这在ACT级推理速度提供了分离多模式 (K模式).实际K值为3-5.
  • 下层式DP+ACT: 在低频率 (1-2Hz) 上使用高水平技能选择 (掌握战略,接近方向) 的扩散政策,以及在高频率 (20Hz) 上执行低水平轨迹的ACT. 这结合了DP的多模式规划和ACT的快速反应控制.

根据硬件平台的推理基准

部署硬件决定了哪个算法是可行的.这些基准使用标准模型尺寸 (ACT:ResNet-18背骨+4层变压器,~25M参数; 扩散政策:ResNet-18+1D U-Net,~55M参数; 一致性政策:与DP相同的架构,蒸到单步).

Algorithm RTX 4090 RTX 3060 Jetson Orin (64GB) Jetson Orin Nano Apple M2 (MPS) CPU (i7-13700)
ACT (chunk=50) 12 ms / 83 Hz 35 ms / 28 Hz 50 ms / 20 Hz 120 ms / 8 Hz 65 ms / 15 Hz 180 ms / 5.5 Hz
ACT (chunk=100) 18 ms / 55 Hz 50 ms / 20 Hz 75 ms / 13 Hz 180 ms / 5.5 Hz 95 ms / 10 Hz 280 ms / 3.5 Hz
DP (DDPM, 100 steps) 150 ms / 6.6 Hz 420 ms / 2.4 Hz 600 ms / 1.7 Hz 1800 ms / 0.6 Hz 550 ms / 1.8 Hz 4200 ms / 0.2 Hz
DP (DDIM, 10 steps) 22 ms / 45 Hz 65 ms / 15 Hz 100 ms / 10 Hz 280 ms / 3.6 Hz 85 ms / 12 Hz 650 ms / 1.5 Hz
DP-T (DDIM, 10 steps) 28 ms / 35 Hz 80 ms / 12.5 Hz 120 ms / 8 Hz 350 ms / 2.9 Hz 105 ms / 9.5 Hz 820 ms / 1.2 Hz
Consistency Policy 15 ms / 66 Hz 45 ms / 22 Hz 70 ms / 14 Hz 200 ms / 5 Hz 60 ms / 16 Hz 350 ms / 2.9 Hz

关键观察: 在桌面GPU以下任何东西上DDPM扩散政策是不可用的.在Jetson Orin上,DDIM带来了10步的DP (对于大多数操纵任务来说,10Hz足够).ACT是Jetson Orin Nano (8Hz与chunk=50) 上唯一以可接受速度运行的算法. 兼容性政策与ACT速度相匹配,同时保留DP的多模式性质,使其成为中端硬件的最佳选择 - - 如果你有资金负担更多的训练时间.

对于移动机器人 (RCSV的Unitree G1,Mobile ALOHA平台),Jetson Orin是标准计算模块.这意味着您的实际选择是ACT,DDIM DP或一致性政策.DDPM DP仅可通过网络连接的桌面GPU (增加5-15ms网络延迟,这对于缓慢任务是可接受的) 实现.

训练效率比较

培训成本取决于数据集大小,GPU硬件和算法.这些基准使用标准设置:2摄像头输入 (224x224),7DOF行动空间,单个NVIDIAGPU.

Scenario ACT (A100) ACT (RTX 3060) DP (A100) DP (RTX 3060) CP (A100)
100 demos, 2K epochs 45 min 2.5 hr 2 hr 8 hr 4 hr*
500 demos, 2K epochs 3 hr 12 hr 8 hr 36 hr 16 hr*
2000 demos, 3K epochs 18 hr 72 hr 48 hr 8+ days 96 hr*
Cloud cost estimate (above) $35 N/A (local) $95 N/A (local) $190*

性政策培训包括基础DP培训+一致性蒸.云成本为A100现场实例.

对于相同数据集尺寸,ACT训练速度比扩散政策快3x,这在快速原型制作时很重要.当你重复数据收集策略和超参数时.典型的开发周期包括5-10次训练评估-收集重复,然后在工作政策上汇聚. 在当地RTX 3060上的500个演示,这相当于ACT的5-10天训练,而DP的15-30天.这本身就证明了开始从ACT开始进行初步任务探索,然后在数据收集完成后转向DP,你想要最大的性能.

任务级成功率比较

基于OpenArm 1+RealSense D435i的公布评估和RCSV内部基准的原始数字.所有政策都基于每个任务的相同示范数据集训练.成功 =在示范时间的2倍内完成的任务.

Task Demos ACT DP (DDIM) CP Winner
Pick cube (single position) 50 92% 85% 88% ACT
Pick cube (random position) 200 78% 84% 82% DP
Peg insertion (tight fit, 1mm) 300 55% 72% 68% DP
Bimanual handover 200 75% 70% 72% ACT
Cloth folding 500 40% 62% 58% DP
Pour liquid (speed-critical) 150 68% 52% 65% ACT
Stack 3 blocks (sequential) 400 35% 48% 45% DP

模式: ACT在需要速度 (倾倒,传递) 和小数据集 (单位选用50个演示) 上获胜. DP在精度任务 (插),高差异性任务 (随机位置,布折) 和更长视野任务 (块堆) 上获胜.随着数据集规模的增加,差距会缩小.

常见的故障模式和调整

两个算法都以可预测的方式失败.识别失败模式告诉你,修复是否更多数据,不同的超参数,或者完全不同的算法.

特定的行为失败

  • **模式平均 (接触附近的动):**该政策平均两个有效的策略 (左对右的方法) 产生一个无处可行的轨迹. 修正:增加KL重量以鼓励模式承诺,或收集更多的示范,以一致使用一个策略.如果任务本质上需要多模式行为,请切换到散策略.
  • ** 分片边界不连续性 (每 N 步骤突然动):** 时间组在连续的分片之间不够平滑. 修复:减少组的重量衰减 (试用 0.005 而不是 0.01) 或增加分片重叠 (每10 步而不是每25 步重新预测).
  • 长时间任务 (>15秒): ACT没有明确的机制来纠正长视线积累的错误.该政策预测开放循环块慢慢偏离预期轨迹.修复:增加重观频率 (每5到10步一次再预测,而不是执行完整的部分),或在块之间增加闭环错误纠正.

传播政策的具体失败

  • ** 缓慢反应对扰乱:** 随着100步DDPM,该政策不能对 500ms 时间内应对意外事件 (物体滑动,人类干预). 修正:切换到10步DDIM或一致性政策.对于反应性子任务,使用混合架构与ACT用于反应性组件.
  • **训练崩 (损失峰值,NaN梯度):**通常发生在3e-4以上的学习率或32以下的批量量下.
  • 过度滑的轨迹 (接器开/关闭太慢): 扩散接过程自然会平滑的作用分布,从而可以圆结接器的接器的过渡. 修复:在训练中增加DDPM步骤的数量 (试用200而不是100) 保持接器的过渡,或后处理接器的尺寸以门 (>0.5 =开,<0.5 =闭).

转换到 转换到 转换到 转换到 转换

对于边缘硬件部署,ACT和DP都从ONNX出口和TensorRT优化中得到了显著的好处.

导出ACT到ONNX为TensorRT导入火从lerobot.common.policies.act.modeling_act导入ACT政策 #加载训练的检查点政策 =ACT政策.from_pretrained("路径/到/检查点") 政策.eval() #创建匹配你的观察空间模拟输入

讯RT FP16优化通常在Jetson硬件上比PyTorch增速2-3倍.对于Jetson Orin的ACT,这将从50ms下降到18-22ms的推断带来.对于DDIM DP,从100ms到35-45ms.FP16量化对两种算法的政策质量产生了微不足道的影响 (在我们的测试中成功率下降低不到1%).

训练技巧对两个算法

# Common training configuration patterns for LeRobot

# ACT config (lerobot/configs/policy/act.yaml)
# Key hyperparameters to tune:
#   chunk_size: 50-100 (longer = smoother but less reactive)
#   kl_weight: 10 (sweep: 1, 5, 10, 50)
#   lr: 1e-4 (reduce to 5e-5 if training is unstable)
#   batch_size: 32-64
#   n_epochs: 2000 (for 200 demos; scale proportionally)

# Diffusion Policy config (lerobot/configs/policy/diffusion.yaml)
# Key hyperparameters:
#   n_diffusion_steps: 100 (DDPM) or 10 (DDIM at inference)
#   prediction_type: "epsilon" (noise prediction; more stable than "sample")
#   lr: 1e-4 with cosine schedule
#   batch_size: 64-128 (DP benefits from larger batches more than ACT)
#   n_epochs: 3000 (for 200 demos; DP converges slower than ACT)

# Both algorithms:
#   - Use action normalization (zero mean, unit variance per dimension)
#   - Use image augmentation (random crop 84-96%, color jitter)
#   - Monitor validation loss every 50 epochs; save best checkpoint
#   - EMA (exponential moving average) of weights at 0.9999 decay

相关阅读

  • [机器人模仿学习:从示范到部署]
  • [LeRobot框架:开始指南]
  • [机器人政策概括:为什么机器人在新物体上失败]
  • [机器人学习的规模规则:2026年我们所知道的内容]
  • [机器人学习:每次示范分析的成本]
  • [RCSV数据收集服务]
  • [RCSV数据平台]

培训您的第一项关于RCSV基础设施的政策

基于RCSV平台,可提供预先构建的ACT和传播政策培训配置,数据集管理和评估工具.

T11)