返回Blog

机器人学习的传播政策:它如何工作,何时使用 (2026)

关于机器人操纵的传播政策: 如何否认预测行动,CNN与变压器,以及它何时超过ACT和行为克隆. 2026指南.

扩散政策是接触丰富和巧妙的机器人操纵任务的领先模仿学习算法.它始终超过标准行为克隆,并且经常超过ACT在多模式示范任务上.本指南解释了它如何工作,如何与ACT和BC相比,哪些超参数最重要,以及在RCSV上将其配合到哪些硬件.

传播政策是什么?

散政策由Chi等人在2023年在哥伦比亚大学引入,从图像生成散模型 (DDPM,DDIM) 应用到机器人行动预测的分数匹配框架.而不是从观察中预测单一下一步行动或短时间的行动序列,该政策学习了反复将随机行动轨迹转化为一致的,高质量的运动计划. 结果是采取行动政策,实际上,处理人类示范数据的多模式性质比经典行为克隆更好.

核心见解很简单:当你收集来自人类操作员的机器人示范时,不同的操作员通常以质量不同的方式完成相同的任务. 经过平均二次错误训练的标准行为克隆模型将在这些模式中平均并产生一个"在"两个有效行为之间"的行为. 由于它模拟了给出的操作的完全有条件分布,因此分散政策可以独立地代表和从每个模式中样本.

该论文展示了12个模拟和实机操纵任务的扩散政策,在其中11个任务中实现了最先进的结果.实机器人任务包括推一个T形块,双手机在鱼上汁,以及一个精确的工具选择任务,具有1mm的放置耐受性.

传播政策的运行方式

对于传播政策的培训和推断遵循标准的DDPM指控框架,适应行动序列而不是图像.

培训

在训练过程中,通过根据噪音时间表在_T_时间段中添加高斯噪音 (通常是T=100) 逐步破坏了清洁行动轨迹T0 (从示范数据集中采样). 网络1D时间CNN或变压器训练以预测每一步增加的噪音,考虑到噪音的行动,指标的步骤指数,以及当前的机器人观察 (图像+自觉).这是标准的分数匹配目标. 网络从 (噪音行动,时间步骤,观察) →预测噪音中学习地图,在所有训练对中,预测和真实的噪音之间的MSE被最小化.

推理

在推断时,模型从一个与行动序列相同的纯噪声向量开始.然后运行 _K_指标步骤 (通常为DDIM K=10,DDPM K=100) 每个步骤都调用神经网络预测噪声组件并减去它,根据当前的观察进行指导. 在K步骤之后,结果是一个完整的行动序列 (通常在10Hz前行1632步,或50100步在50Hz前行),这代表了可行的,流的持续现状.

观察条件是主要的建筑选择. 扩散政策支持两个编码选项:

  • **基于CNN (DP-C):**一个ResNet-18或ResNet-34背骨将图像观测编码成一个特征向量,然后与自觉状态合并并并用于调节无视CNN.训练和推断更快,更适合单摄像头设置.
  • **基于变压器 (DP-T):**一个ViT式变压器编码图像代码并与自体感知代码合并.多摄像头设置更具表达性;推断速度更慢 (120msvs40ms在RTX 3090).

终止视野控制

重要实施细节:扩散政策采用退缩视界方法.该政策预测长度 Tp (例如16步),但在重新规划之前只执行第一个 _Ta_步骤 (例如8步).这创造了时间一致性 (长时间 Tp = 更平滑的运动) 和反应性 (更短的 Ta = 快速响应意想不到的变化) 之间的平衡. 对于大多数操作任务, tp/Ta = 2 的比率是标准的默认,

传播政策与法案:一个实际的比较

Property Diffusion Policy ACT (Action Chunking Transformers)
Multimodal action distributions Excellent — models full distribution Good — CVAE captures variance but can mode-average
Inference latency (RTX 3090) 40–120ms (DDIM K=10 to K=100) ~10ms (single forward pass)
Training time (50 demos, RTX 3090) 4–8 hours (CNN), 8–16 hours (Transformer) 2–4 hours
Temporal consistency High — denoising produces smooth trajectories High — action chunking provides consistency
Bimanual coordination Good with transformer variant Excellent — natively designed for ALOHA bimanual
Dexterous hand control (20+ DOF) Excellent — handles high-dim action spaces well Moderate — chunk size tuning needed for high DOF
Open-source reference implementation Yes — diffusion_policy repo (Columbia) Yes — act repo (Stanford)
LeRobot integration Yes — native support Yes — native support

标题比较:ACT在推断方面更快,训练更容易,这使得它更适合具有时间关键的系统和有限计算的团队. 扩散政策更自然地处理多模式示范,更好地适应高维度的行动空间,如精明的手. 实际上,对于大多数桌面操作任务,50200个清洁演示的性能是可比较的.当演示的自然变化或行动空间超过14DOF时,选择扩散政策.查看我们的 [ACT政策指南]T10) 来深入了解ACT特定调整.

传播政策与标准行为克隆

标准行为克隆 (BC) 减少了预测和示范行动之间的MSE. 这在示范数据集是单模的时就能工作,当每个操作员都以相同的方式完成任务时.问题是人类示范几乎从来没有. 当 BC 政策看到一个在示范中出现的观察,其中有两个不同的后续行动时,它平均它们,产生了在两种情况下错误的运动. 这被称为模式平均问题.

由于这种情况,一个分散政策从一个模式或另一个模式中一致地采样,从未平均它们. 这就是为什么原始论文显示了比 BC 具有较高示范差异的任务中最大的改进:推力任务 (运营商从不同的角度推块) 和双手散布任务 (运营商使用不同的协调策略).

实际上,如果您的任务在已证明的轨迹中差异不到5% (即所有操作员都做完全相同的事情),BC具有良好的脊椎可以匹配扩散政策.

什么时候选择传播政策

在:

  • 您的演示是多模式的. 如果不同的运营商通过有意义的不同的运动策略完成任务,
  • 你有一个高DOF行动空间. 手 (1620+DOF) 更多地受益于扩散政策在整个行动维度中模拟关联相关性的能力,而不是ACT的固定基于零件的方法.
  • 需要精确的终点定位. 原文显示,由于在脱过程中进行反复精炼,在精确插入任务上,扩散政策可以实现2mm以下的定位精度.
  • **您正在根据发表的结果进行基准评估.**许多最近的论文 (20242026) 报告了传播政策作为基线.
  • 您的GPU预算为训练增加. 如果您拥有多个GPU,扩散政策训练将相对而行,而变压器变体则会通过更大的计算获得更好的结果.

选择ACT 当:

  • ** 推理延迟至关重要.** 每次推理步骤的10ms,ACT可以在适度硬件上运行100Hz. 40120ms的扩散政策为K=10100的825Hz.
  • 您正在使用ALOHA格式双手动数据工作. ACT是为ALOHA设计的,并且参考实现不需要格式转换.
  • 培训计算有限. 两个小时的ACT培训与48小时的传播政策课程相比,当你在任务设计中快速进行回复.
  • 你与特定的先前结果相匹配. 如果你需要精确地复制斯坦福的ACT数字,请使用ACT.

扩散政策的关键超参数

实际上,针的作用是以下几种:

Parameter Default Effect of Increasing
pred_horizon (Tp) 16 Smoother trajectories; slower re-planning; more memory
action_horizon (Ta) 8 Fewer inference calls; less reactive to perturbations
obs_horizon 2 More temporal context; helps with tasks requiring memory of recent motion
num_diffusion_iters (K) 10 (DDIM), 100 (DDPM) Higher quality actions; slower inference
noise_scheduler DDIM DDPM is higher quality but 10x slower; DDIM preferred for real-time use
vision_encoder ResNet-18 ResNet-34 / ViT improves performance; requires more compute
n_obs_steps 2 Stacking more observation frames helps tasks with motion-based cues (sliding, rotating)

最常见的错误:设置T8太长和T9太短. 这产生了过度承诺计划轨迹的政策,并无法对接触事件作出反应.对于巧妙的操纵,建议的起点是 Tp=16, Ta=8 ,然后根据你所观察到的任务故障模式调整.

设置扩散政策 (哥伦比亚参考实现) git clone T24 cd diffusion_policy conda env创建 -f conda_environment.yaml conda激活robodiff # 列车CNN变体在Push-T数据集 python train.py --config-name=train_diffusion_unet_lowdim_push_t_work space # 列车在自己的数据集 (Le train.t_work space) python.py --config-name=train_diffusion\unet_hybrid_work space \任务.数据集\path=/to/your/lerobot_dat_task._actionhorizon=16 \horizon._horizon_task.\horizon\\2_horizon_task.\e_size=25_batch_task.\3_

通过传播政策有效的数据集

传播政策在具有以下特征的数据集上表现最好:

  • 滑,连续轨迹由于测试过程产生滑的输出,因此动或不连续运动的示范使模型的诱导偏差与训练数据之间产生不匹配.
  • ** 始终效应状态记录:** 标准CNN变体的扩散政策使用终端效应位置+定向+抓住器作为操作,而不是关节角.如果你的数据集记录关节角,你需要前进动力学层或训练关节空间变体.
  • **可用时多个视图:**变压器变体 (DP-T) 可以使用23摄像头视图作为代币.多视图设置在闭或深度模糊的任务上始终优于单视图.

发布的基准数据集与传播政策兼容

Dataset Tasks Notes
Push-T (Columbia) T-block pushing Reference benchmark; highly multimodal; download from diffusion_policy repo
RoboMimic Can, Lift, Square, Transport Standard benchmark; MH (multi-human) subset tests multimodal handling best
ALOHA / ACT datasets Bimanual tabletop tasks Requires joint-space conversion; diffusion policy-T performs comparably to ACT
DROID (Google) 76,000 diverse robot episodes Large-scale; good for fine-tuning pretrained diffusion models
RCSV custom datasets Varies by project Delivered in LeRobot format; compatible with diffusion_policy repo out of the box

关于扩散政策的RCSV硬件建议

的任务:武吉手

对于需要指尖水平的技巧的任务,[武吉手]是RCSV的最强大的扩散政策平台.每指尖有20个活跃的DOF和768点触觉传感,它提供了丰富的行动空间和丰富的观察空间,这种扩散政策的变体变体可以充分利用. 在我们的内部基准中,Wuji Hand上的传播政策-T在接触丰富的指互动任务上超过了ACT的成功率1825个百分点.

对于DP-T变压器,我们平坦化和代码化768个维度观测向量.与纯视觉政策相比,训练时间增加了大约40%,但像插入针,线缆路由和表面检查等接触敏感任务的成功率显著提高.

桌面操作:开臂基

对于标准桌面选用,组装和工具使用任务,OpenArm Base是扩散政策工作的最经济效率平台.它运行在50Hz的联合位置控制,支持标准的6DOF+抓住器行动空间,该扩散政策的参考实现目标,并将数据以LeRobot格式原生地出口. 通过使用100次示范的OpenArm数据集,CNN的传播政策变体在46小时内在单个RTX 4090上运行.

对于双手 OpenArm 设置 (共享安装框架上的两个臂),转变器变体建议 双手关联状态向量中额外的交叉注意力捕捉了CNN变体错过的双手协调模式.

计算要求

Configuration Minimum Recommended
DP-C (CNN, single camera) RTX 3060 12GB, 32GB RAM RTX 3090 24GB, 64GB RAM
DP-T (Transformer, 3 cameras) RTX 4080 16GB, 64GB RAM RTX 4090 24GB or A100 40GB
DP-T + Wuji tactile (768D obs) RTX 4090 24GB, 128GB RAM A100 80GB or 2x RTX 4090

T13) 提供了可访问A100培训节点,用于超越本地计算能力的扩散政策运行.

常见的问题

机器人技术的传播政策是什么?

扩散政策是一种模仿学习算法,将行动预测视为一种否定扩散过程.在推断时,它从随机高斯噪音开始,并反复改进它,以根据当前机器人观测的一致的行动序列. 这种方法可以代表多模式的行动分布, 完成任务的多种有效方法, 标准行为克隆甚至ACT都与此斗争.

我应该什么时候使用传播政策而不是ACT?

扩散政策是当你的任务具有多模式示范时 (运营商以不同的方式完成相同任务时),当你需要精确的终点控制时,或者当你的示范具有高差异时,更好的选择.ACT在推断上更快,需要更少的计算来训练,因此对于延迟限制的应用程序和有限的GPU资源的团队来说更好. 对于大多数桌面操作任务,ACT和传播政策的表现是相对的. 详细的分类请参阅我们的 [ACT与传播政策指南]

培训传播政策需要多长时间?

在一个单个RTX 3090或RTX 4090上,训练基于CNN的传播政策 (基于标准桌面数据集 (50200集) 需要48小时.基于变压器的变体需要816小时用于相同的数据集尺寸.训练时间大致与数据集尺寸相对线性.RCSV的平台提供预配置的训练管道,从而降低设置时间到30分钟以下.

什么硬件能最好地使用扩散政策?

扩散政策最初是需要精确,顺的轨迹:推进,插入和选择.对于精巧的指尖水平任务,[T15] (DOF,768点触摸) (20 DOF,T16) 与扩散政策相对应,在接触丰富的操作任务上比ACT更高.对于桌面手臂任务,[OpenArm Base]T16) 是最经济的平台. 通过管理数据收集和培训管道,RCSV支持两个配置.

相关阅读

  • T17) 动作和变形机深入潜水
  • 双手论坛,为ACT和传播政策
  • 基准数据集与传播政策兼容
  • [模仿学习的最佳机器人]T20) 平台比较
  • RCSV数据服务 管理数据收集+培训管道