返回Research

行动<unk>缩与全轨迹模仿:一个实用的比较

什么时候使用行动<unk>缩 (ACT) 与整个轨迹行为克隆. 延迟,任务视野和训练数据影响.

了解何时预测行动块与整个轨迹以及选择如何影响机器人的性能,培训成本和部署延迟.

无明行为克隆问题

标准行为克隆 (BC) 训练一个政策 πa 们的预测,以预测下一步的行动,考虑到当前的观察.这对短暂,低变量任务很好,但随着任务复杂性增加,它会在两个关键的方式分解.

首先,复合错误:小预测错误将机器人转移到稍微陌生的状态,导致更大的错误,从而进一步转移状态导致任务完成之前发生灾难性失败.这是经典的DAGger问题. 在实践中,BC对桌面任务的政策在培训部署期间通常成功80% (这些政策在分配中保持) 但在部署同一任务时失败4050%

第二, 模式平均:当同一任务存在多个有效的策略时 (例如从左或右抓住对象),一个单模 BC 政策平均了示范,产生了一个中途轨迹,没有一个策略都成功执行.

行动缩是什么?

通过从当前观察中预测H未来行动的_序列_,然后在再次查询政策之前执行第一个k行动,在ACT论文中引入的行动分类 (Zhao et al., 2023),解决了组合错误.

政策 π(a_{t:t+H} 们的s_t) 一次输出了大量的H行动.H=100在50Hz控制,一个单次查询覆盖了2秒的运动.关键的见解:通过预测一个短视线计划而不是一个单次步骤,政策利用时间背景来承诺一个连贯的战略,避免平均问题.

  • 部分大小H: 预测在单个查询中预测的未来时间步骤.在50Hz的桌面操作中,H=100 (2秒) 是标准的ACT配置.较大的H涵盖更多的任务,但给政策更少的机会反应意外状态.
  • 重组频率 k: 在再次查询政策之前执行的操作数.在ACT中,k=H/4到H (完全执行部分,没有重组).时间组 (重叠部分预测的权重平均值) 进一步平滑执行.
  • **CVAE编码器:**ACT使用条件变量自动编码器编码整个示范的风格/模式,使得政策能够承诺一个策略而不是平均.这是处理多模式示范的主要机制.

扩散政策:通过断断碎片

扩散政策 (Chi et al., 2023) 通过不同的机制实现类似的多种模式处理:将行动分布作为一个扩散过程模型在一块行动中. 该政策指的是基于当前观察的噪音动作序列.

  • **U-Net扩散:**一个卷积式U-Net表示行动块.比基于变压器的扩散更快的推理 (在GPU上~1050 ms). 首选用于结构化,重复运动的任务.
  • 变压器扩散: 较好在行动序列中捕捉长距离依赖性. 较慢 (~100300 ms).更适合复杂的双手或多步骤任务.
  • 典型的零件尺寸: H=816对于10Hz控制政策; H=3264对于50Hz控制政策.

任务视野分析

适当的部分尺寸和重组频率大大取决于任务视野:

  • **短视野任务 (<3秒):**简单的选择和放置,杯子堆.BC经常有效.如果使用ACT,H=50100在50Hz时涵盖整个任务.在一个或两个查询中.H=1632的扩散也有效.
  • 水平任务 (315秒):插入,线缆路由,食品组装.这是ACT的甜点点.H=100涵盖2秒;每2550步 (0.51秒) 进行重新规划,使政策保持反应性.推时间组.
  • 长视野任务 (>30秒): 完整的工作流程,多抽组装,室内组织.单层次的分断失败在这里 分断不能覆盖整个任务,但长分断失去了反应性. 层次方法 (高级任务规划器 + 低级分断执行器) 是必要的. 像RT-2或OpenVLA这样的VLM处理高层次任务分解;ACT或扩散处理低层次执行.

培训数据要求

碎的数据改变了您的数据需求

  • 时间一致性要求: 行动零碎假设示范中的连续时间步骤是连贯计划的一部分.示范中的犹,纠正和后退会混零碎预测器.对于噪音任务,行动零碎需要大约2倍多的数据比BC来实现相同的性能,因为更大的部分演示必须高质量.
  • 多模式覆盖: ACT中CVAE需要至少2030次展示每个不同的策略,以学习清洁的隐形模式.如果你的任务有3个有效的策略,你需要6090次演示,仅仅是模式覆盖,在一般政策质量之前.
  • ** 剧集长度正常化:** 变长的剧集对固定部分预测产生挑战. 考虑在训练中将剧集填充到标准长度或使用部分掩盖.

绩效基准

Algorithm ALOHA Insertion ALOHA Transfer Cube ALOHA Slot Battery Inference 延迟
行为克隆 45% 62% 30% 2–5 ms
ACT (H=100) 80% 92% 65% 15–30 ms
Diffusion Policy (U-Net) 76% 88% 60% 10–50 ms
Diffusion Policy (Transformer) 82% 91% 68% 100–300 ms
ACT + temporal ensemble 83% 94% 70% 20–40 ms

上面的结果来自原始的ACT论文 (Zhao et al., 2023) 和 Chi et al. (2023) 关于ALOHA双手操作基准.你的结果将根据任务,数据质量和硬件而异.

关于算法适合您的任务和数据情况的建议,请参阅 RCSV培训平台基础模型调查.

按任务类型的建议

Task Type Recommended Algorithm Chunk Size Notes
Simple pick-and-place BC or ACT N/A or H=50 BC sufficient if single strategy
精度 insertion ACT or Diffusion-T H=100 Multi-modality in approach angle
Bimanual coordination ACT H=100–200 Joint state space required
Long-horizon (>30s) Hierarchical (VLM + ACT) H=50–100 per subtask Subtask decomposition required
Deformable objects Diffusion Policy H=32–64 Diffusion handles uncertainty better
High-speed (>5 Hz query) BC or U-Net Diffusion H=8–16 Transformer diffusion too slow

在RCSV平台上训练您的政策

通过自动超参数搜索,RCSV培训平台支持BC,ACT,扩散政策和OpenVLA细节调整.

探索平台 →