机器人学习的传播政策:它如何工作,何时使用 (2026)
关于机器人操纵的传播政策: 如何否认预测行动,CNN与变压器,以及它何时超过ACT和行为克隆. 2026指南.
扩散政策是接触丰富和巧妙的机器人操纵任务的领先模仿学习算法.它始终超过标准行为克隆
传播政策是什么?
核心见解很简单:当你收集来自人类操作员的机器人示范时,不同的操作员通常以质量不同的方式完成相同的任务. 经过平均二次错误训练的标准行为克隆模型将在这些模式中平均并产生一个"在"两个有效行为之间"的行为. 由于它模拟了给出的操作的完全有条件分布,因此分散政策可以独立地代表和从每个模式中样本.
该论文展示了12个模拟和实机操纵任务的扩散政策,在其中11个任务中实现了最先进的结果.实机器人任务包括推一个T形块,双手机在
传播政策的运行方式
对于传播政策的培训和推断遵循标准的DDPM指控框架,适应行动序列而不是图像.
培训
在训练过程中,通过根据噪音时间表在_T_时间段中添加高斯噪音 (通常是T=100) 逐步破坏了清洁行动轨迹
推理
在推断时,模型从一个与行动序列相同的纯噪声向量开始.然后运行 _K_指标步骤 (通常为DDIM K=10,DDPM K=100)
观察条件是主要的建筑选择. 扩散政策支持两个编码选项:
- **基于CNN (DP-C):**一个ResNet-18或ResNet-34背骨将图像观测编码成一个特征向量,然后与自觉状态合并并并用于调节无视CNN.训练和推断更快,更适合单摄像头设置.
- **基于变压器 (DP-T):**一个ViT式变压器编码图像代码并与自体感知代码合并.多摄像头设置更具表达性;推断速度更慢 (120msvs40ms在RTX 3090).
终止视野控制
重要实施细节:扩散政策采用退缩视界方法.该政策预测长度 Tp (例如16步),但在重新规划之前只执行第一个 _Ta_步骤 (例如8步).这创造了时间一致性 (长时间 Tp = 更平滑的运动) 和反应性 (更短的 Ta = 快速响应意想不到的变化) 之间的平衡. 对于大多数操作任务, tp/Ta = 2 的比率是标准的默认,
传播政策与法案:一个实际的比较
| Property | Diffusion Policy | ACT (Action Chunking Transformers) |
|---|---|---|
| Multimodal action distributions | Excellent — models full distribution | Good — CVAE captures variance but can mode-average |
| Inference latency (RTX 3090) | 40–120ms (DDIM K=10 to K=100) | ~10ms (single forward pass) |
| Training time (50 demos, RTX 3090) | 4–8 hours (CNN), 8–16 hours (Transformer) | 2–4 hours |
| Temporal consistency | High — denoising produces smooth trajectories | High — action chunking provides consistency |
| Bimanual coordination | Good with transformer variant | Excellent — natively designed for ALOHA bimanual |
| Dexterous hand control (20+ DOF) | Excellent — handles high-dim action spaces well | Moderate — chunk size tuning needed for high DOF |
| Open-source reference implementation | Yes — diffusion_policy repo (Columbia) | Yes — act repo (Stanford) |
| LeRobot integration | Yes — native support | Yes — native support |
标题比较:ACT在推断方面更快,训练更容易,这使得它更适合具有时间关键的系统和有限计算的团队. 扩散政策更自然地处理多模式示范,更好地适应高维度的行动空间,如精明的手. 实际上,对于大多数桌面操作任务,50
传播政策与标准行为克隆
标准行为克隆 (BC) 减少了预测和示范行动之间的MSE. 这在示范数据集是单模的时就能工作
由于这种情况,一个分散政策从一个模式或另一个模式中一致地采样,从未平均它们. 这就是为什么原始论文显示了比 BC 具有较高示范差异的任务中最大的改进:推力任务 (运营商从不同的角度推块) 和双手散布任务 (运营商使用不同的协调策略).
实际上,如果您的任务在已证明的轨迹中差异不到5% (即所有操作员都做完全相同的事情),BC具有良好的脊椎可以匹配扩散政策.
什么时候选择传播政策
在:
- 您的演示是多模式的. 如果不同的运营商通过有意义的不同的运动策略完成任务,
- 你有一个高DOF行动空间.
手 (16 20+DOF) 更多地受益于扩散政策在整个行动维度中模拟关联相关性的能力,而不是ACT的固定基于零件的方法. - 需要精确的终点定位. 原文显示,由于在脱
过程中进行反复精炼,在精确插入任务上,扩散政策可以实现2mm以下的定位精度. - **您正在根据发表的结果进行基准评估.**许多最近的论文 (2024
2026) 报告了传播政策作为基线. - 您的GPU预算为训练增加. 如果您拥有多个GPU,扩散政策训练将相对而行,而变压器变体则会通过更大的计算获得更好的结果.
选择ACT 当:
- ** 推理延迟至关重要.** 每次推理步骤的10ms,ACT可以在适度硬件上运行100Hz. 40
120ms的扩散政策为K=10 100的8 25Hz. - 您正在使用ALOHA格式双手动数据工作. ACT是为ALOHA设计的,并且参考实现不需要格式转换.
- 培训计算有限. 两个小时的ACT培训与4
8小时的传播政策课程相比,当你在任务设计中快速进行回复. - 你与特定的先前结果相匹配. 如果你需要精确地复制斯坦福的ACT数字,请使用ACT.
扩散政策的关键超参数
实际上,针的作用是以下几种:
| Parameter | Default | Effect of Increasing |
|---|---|---|
pred_horizon (Tp) |
16 | Smoother trajectories; slower re-planning; more memory |
action_horizon (Ta) |
8 | Fewer inference calls; less reactive to perturbations |
obs_horizon |
2 | More temporal context; helps with tasks requiring memory of recent motion |
num_diffusion_iters (K) |
10 (DDIM), 100 (DDPM) | Higher quality actions; slower inference |
noise_scheduler |
DDIM | DDPM is higher quality but 10x slower; DDIM preferred for real-time use |
vision_encoder |
ResNet-18 | ResNet-34 / ViT improves performance; requires more compute |
n_obs_steps |
2 | Stacking more observation frames helps tasks with motion-based cues (sliding, rotating) |
最常见的错误:设置
设置扩散政策 (哥伦比亚参考实现) git clone
通过传播政策有效的数据集
传播政策在具有以下特征的数据集上表现最好:
- 滑,连续轨迹由于测试过程产生滑的输出,因此
动或不连续运动的示范使模型的诱导偏差与训练数据之间产生不匹配. - ** 始终效应状态记录:** 标准CNN变体的扩散政策使用终端效应位置+定向+抓住器作为操作,而不是关节角.如果你的数据集记录关节角,你需要前进动力学层或训练关节空间变体.
- **可用时多个视图:**变压器变体 (DP-T) 可以使用2
3摄像头视图作为代币.多视图设置在 闭或深度模糊的任务上始终优于单视图.
发布的基准数据集与传播政策兼容
| Dataset | Tasks | Notes |
|---|---|---|
| Push-T (Columbia) | T-block pushing | Reference benchmark; highly multimodal; download from diffusion_policy repo |
| RoboMimic | Can, Lift, Square, Transport | Standard benchmark; MH (multi-human) subset tests multimodal handling best |
| ALOHA / ACT datasets | Bimanual tabletop tasks | Requires joint-space conversion; diffusion policy-T performs comparably to ACT |
| DROID (Google) | 76,000 diverse robot episodes | Large-scale; good for fine-tuning pretrained diffusion models |
| RCSV custom datasets | Varies by project | Delivered in LeRobot format; compatible with diffusion_policy repo out of the box |
关于扩散政策的RCSV硬件建议
精的任务:武吉手
对于需要指尖水平的技巧的任务,[武吉手]是RCSV的最强大的扩散政策平台.每指尖有20个活跃的DOF和768点触觉传感,它提供了丰富的行动空间和丰富的观察空间,这种扩散政策的变体变体可以充分利用. 在我们的内部基准中,Wuji Hand上的传播政策-T在接触丰富的指互动任务上超过了ACT的成功率18
对于DP-T变压器,我们平坦化和代码化768个维度观测向量.与纯视觉政策相比,训练时间增加了大约40%,但像插入针,线缆路由和表面检查等接触敏感任务的成功率显著提高.
桌面操作:开臂基
对于标准桌面选用,组装和工具使用任务,OpenArm Base是扩散政策工作的最经济效率平台.它运行在50Hz的联合位置控制,支持标准的6DOF+抓住器行动空间,该扩散政策的参考实现目标,并将数据以LeRobot格式原生地出口. 通过使用100次示范的OpenArm数据集,CNN的传播政策变体在4
对于双手 OpenArm 设置 (共享安装框架上的两个臂),转变器变体建议
计算要求
| Configuration | Minimum | Recommended |
|---|---|---|
| DP-C (CNN, single camera) | RTX 3060 12GB, 32GB RAM | RTX 3090 24GB, 64GB RAM |
| DP-T (Transformer, 3 cameras) | RTX 4080 16GB, 64GB RAM | RTX 4090 24GB or A100 40GB |
| DP-T + Wuji tactile (768D obs) | RTX 4090 24GB, 128GB RAM | A100 80GB or 2x RTX 4090 |
常见的问题
机器人技术的传播政策是什么?
扩散政策是一种模仿学习算法,将行动预测视为一种否定扩散过程.在推断时,它从随机高斯噪音开始,并反复改进它,以根据当前机器人观测的一致的行动序列. 这种方法可以代表多模式的行动分布, 完成任务的多种有效方法, 标准行为克隆甚至ACT都与此斗争.
我应该什么时候使用传播政策而不是ACT?
扩散政策是当你的任务具有多模式示范时 (运营商以不同的方式完成相同任务时),当你需要精确的终点控制时,或者当你的示范具有高差异时,更好的选择.ACT在推断上更快,需要更少的计算来训练,因此对于延迟限制的应用程序和有限的GPU资源的团队来说更好. 对于大多数桌面操作任务,ACT和传播政策的表现是相对的. 详细的分类请参阅我们的 [ACT与传播政策指南]
培训传播政策需要多长时间?
在一个单个RTX 3090或RTX 4090上,训练基于CNN的传播政策 (基于标准桌面数据集 (50
什么硬件能最好地使用扩散政策?
扩散政策最初是需要精确,顺
相关阅读
T17 ) 动作 和变形机深入潜水 双手论坛,为ACT和传播政策 基准数据集与传播政策兼容 - [模仿学习的最佳机器人]
T20 ) 平台比较 - RCSV数据服务
管理数据收集+培训管道







