行动<unk>缩与全轨迹模仿:一个实用的比较
什么时候使用行动<unk>缩 (ACT) 与整个轨迹行为克隆. 延迟,任务视野和训练数据影响.
了解何时预测行动块与整个轨迹
无明行为克隆问题
标准行为克隆 (BC) 训练一个政策 πa 们的预测,以预测下一步的行动,考虑到当前的观察.这对短暂,低变量任务很好,但随着任务复杂性增加,它会在两个关键的方式分解.
首先,复合错误:小预测错误将机器人转移到稍微陌生的状态,导致更大的错误,从而进一步转移状态
第二, 模式平均:当同一任务存在多个有效的策略时 (例如从左或右抓住对象),一个单模 BC 政策平均了示范,产生了一个中途轨迹,没有一个策略都成功执行.
行动缩是什么?
通过从当前观察中预测H未来行动的_序列_,然后在再次查询政策之前执行第一个k行动,在ACT论文中引入的行动分类 (Zhao et al., 2023),解决了组合错误.
政策 π(a_{t:t+H} 们的s_t) 一次输出了大量的H行动.H=100在50Hz控制,一个单次查询覆盖了2秒的运动.关键的见解:通过预测一个短视线计划而不是一个单次步骤,政策利用时间背景来承诺一个连贯的战略,避免平均问题.
- 部分大小H: 预测在单个查询中预测的未来时间步骤.在50Hz的桌面操作中,H=100 (2秒) 是标准的ACT配置.较大的H涵盖更多的任务,但给政策更少的机会反应意外状态.
- 重组频率 k: 在再次查询政策之前执行的操作数.在ACT中,k=H/4到H (完全执行部分,没有重组).时间组 (重叠部分预测的权重平均值) 进一步平滑执行.
- **CVAE编码器:**ACT使用条件变量自动编码器编码整个示范的风格/模式,使得政策能够承诺一个策略而不是平均.这是处理多模式示范的主要机制.
扩散政策:通过断断碎片
扩散政策 (Chi et al., 2023) 通过不同的机制实现类似的多种模式处理:将行动分布作为一个扩散过程模型在一块行动中. 该政策指的是基于当前观察的噪音动作序列.
- **U-Net扩散:**一个卷积式U-Net表示行动块.比基于变压器的扩散更快的推理 (在GPU上~10
50 ms). 首选用于结构化,重复运动的任务. - 变压器扩散: 较好在行动序列中捕捉长距离依赖性. 较慢 (~100
300 ms).更适合复杂的双手或多步骤任务. - 典型的零件尺寸: H=8
16对于10Hz控制政策; H=32 64对于50Hz控制政策.
任务视野分析
适当的部分尺寸和重组频率大大取决于任务视野:
- **短视野任务 (<3秒):**简单的选择和放置,杯子堆
.BC经常有效.如果使用ACT,H=50 100在50Hz时涵盖整个任务.在一个或两个查询中.H=16 32的扩散也有效. - 中
水平任务 (3 15秒): 插入,线缆路由,食品组装.这是ACT的甜点点.H=100涵盖2秒;每25 50步 (0.5 1秒) 进行重新规划,使政策保持反应性.推 时间组. - 长视野任务 (>30秒): 完整的
工作流程,多抽 组装,室内组织.单层次的分断失败在这里 分断不能覆盖整个任务,但长分断失去了反应性. 层次方法 (高级任务规划器 + 低级分断执行器) 是必要的. 像RT-2或OpenVLA这样的VLM处理高层次任务分解;ACT或扩散处理低层次执行.
培训数据要求
- 时间一致性要求: 行动零碎假设示范中的连续时间步骤是连贯计划的一部分.示范中的犹
,纠正和后退会混 零碎预测器.对于噪音任务,行动零碎需要大约2倍多的数据比BC来实现相同的性能,因为更大的部分演示必须高质量. - 多模式覆盖: ACT中CVAE需要至少20
30次展示每个不同的策略,以学习清洁的隐形模式.如果你的任务有3个有效的策略,你需要60 90次演示,仅仅是模式覆盖,在一般政策质量之前. - ** 剧集长度正常化:** 变长的剧集对固定部分预测产生挑战. 考虑在训练中将剧集填充到标准长度或使用部分掩盖.
绩效基准
| Algorithm | ALOHA Insertion | ALOHA Transfer Cube | ALOHA Slot Battery | Inference 延迟 |
|---|---|---|---|---|
| 行为克隆 | 45% | 62% | 30% | 2–5 ms |
| ACT (H=100) | 80% | 92% | 65% | 15–30 ms |
| Diffusion Policy (U-Net) | 76% | 88% | 60% | 10–50 ms |
| Diffusion Policy (Transformer) | 82% | 91% | 68% | 100–300 ms |
| ACT + temporal ensemble | 83% | 94% | 70% | 20–40 ms |
上面的结果来自原始的ACT论文 (Zhao et al., 2023) 和 Chi et al. (2023) 关于ALOHA双手操作基准.你的结果将根据任务,数据质量和硬件而异.
关于算法适合您的任务和数据情况的建议,请参阅 RCSV培训平台 或 基础模型调查.
按任务类型的建议
| Task Type | Recommended Algorithm | Chunk Size | Notes |
|---|---|---|---|
| Simple pick-and-place | BC or ACT | N/A or H=50 | BC sufficient if single strategy |
| 精度 insertion | ACT or Diffusion-T | H=100 | Multi-modality in approach angle |
| Bimanual coordination | ACT | H=100–200 | Joint state space required |
| Long-horizon (>30s) | Hierarchical (VLM + ACT) | H=50–100 per subtask | Subtask decomposition required |
| Deformable objects | Diffusion Policy | H=32–64 | Diffusion handles uncertainty better |
| High-speed (>5 Hz query) | BC or U-Net Diffusion | H=8–16 | Transformer diffusion too slow |
在RCSV平台上训练您的政策
通过自动超参数搜索,RCSV培训平台支持BC,ACT,扩散政策和OpenVLA细节调整.







