返回Blog

机器人操纵的模仿学习:一个决策指南

什么时候使用强化学习与模仿学习培训机器人操纵政策 任务类型,数据可用性和计算预算.

部分: [模仿学习指南]

[←博客]

选择RL和IL不是关于哪个更好而是关于哪个适合您的特定限制.

快速决定的规则

在详细分析之前:如果您可以轻松地通过远程操作系统证明任务,请使用模仿学习.如果您无法证明它,但可以定义一个清晰的尺度奖励信号,请使用RL.如果没有任何一个都适用,任务太复杂了从一个更简单的子任务开始.

这一规则适用于80%的实践操纵场景,剩余20%需要混合方法或仔细分析下面的权衡.

模仿学习:优势和局限性

常被低估的优势:

  • **快速发展周期:**100次示范 →经过2~4小时的培训政策.
  • ** 建筑安全:** 政策学会保持在已被证明的行为附近. 它不会像RL探险家那样发现危险的边缘事件.
  • 没有奖励工程: 定义一个精确组装的奖励函数是惊人的困难.
  • **可预测成本:**每次性能改善的成本是线性和可测量的 收集更多的100个演示,预计N%的改善.

含量限制:

  • 由示范人员质量限制: 该政策不能超过示范人员的技能.
  • ** 组合错误:** 行为克隆从长时间水平上从训练分布中转移.
  • 不能发现不明显的解决方案: 如果有一个难以证明但易于执行的策略 (例如,使用惯性动力来将物体扔进垃圾桶),IL将永远不会找到它.

加强学习:优势和局限性

利:

  • **可以超越人类的性能:**RL在游戏中发现了超人策略,并发现了对特定物体的非直观但优越的把握策略.
  • **处理不可证明的行为:**人类无法轻松控制机器人 (高速动态,复杂的接触序列) 的任务是自然的RL目标.
  • 长远规划: 通过有形好的奖励,RL可以处理20-50步骤的任务,这些任务容易导致IL的错误.

经常低估的RL限制:

  • **样本效率:**现代操作RL需要500K-5M环境步骤进行简单的任务.在10Hz模拟时,这相当于14-14小时的模拟时间,大小数量比IL更多的数据.
  • 奖励工程难度: 节省奖励 (仅成功/失败) 很少没有仔细的塑造工作.对操纵的密集奖励功能很难正确地指定.错误的塑造的奖励产生利用奖励而不是解决任务的政策.
  • **实体机器人上的真实世界RL可能但慢而昂贵.RL几乎总是需要模拟,这需要sim-to-real转移.

面对面的比较

Dimension 模仿学习 Reinforcement Learning
Sample efficiency 100-500 demos for most tasks 500K-5M sim steps (much more data)
Reward design needed? No (demonstrations are the reward) Yes (hardest part of the pipeline)
Simulation required? No (works on real robot directly) Practically yes (real-world RL is too slow)
Hardware access needed? Yes (physical robot + teleoperation) Only for validation (training is in sim)
GPU compute cost $5-50 per policy (2-12 hr training) $50-500 per policy (8-100 hr training)
Performance ceiling Bounded by demonstrator skill Can exceed human performance
Safety during training Inherently safe (follows demo distribution) 探索 can be dangerous on real hardware
Time to first policy 1-3 days (collect + train) 1-4 weeks (sim setup + training)
Sim-to-real gap? No (trained on real data) Yes (major challenge for deployment)
Multi-task scaling Linear cost per task (need demos for each) Reward re-engineering per task (often harder)

决策流程图

按照这个问题序列来确定您的具体任务的正确方法:

  1. 如果是,IL是你的起点.如果没有 (例如,任务需要超人速度,反应时间或自由控制程度),请进入步骤3.
  2. **任务是否需要超出示范人员能力的精度?**如果IL政策达到70-80%,但你需要95%+的成功,请使用IL热启动+RL精炼 (混合).如果IL独自达到目标,请停止.
  3. 您可以定义任务的 skalar 奖励函数吗? 如果是的,并且您可以访问模拟,请使用 RL. 如果奖励是模糊的或多目标的,请考虑 GAIL (使用示范来学习奖励) 或将任务分为更明确的奖励子任务.
  4. **如果任务涉及具有已知几何学的硬体,则通常是可行的.如果涉及可变形的物体,流体或复杂的接触动态,则sim fidelity可能不足 - - 默认在实际硬件上IL.
  5. 您的计算预算是多少? 如果您可以访问A100/H100GPU,并且可以承担10-100小时的培训时间,RL是实用的. 如果您的计算量有限 (单个RTX 3090或云现场实例),IL的计算效率是10-100倍.

混合方法:两种方法最好

Approach Description Benefit When to Use
IL warm-start + RL fine-tuning Train IL policy first, use as RL initialization 10× more efficient RL When IL policy is 60-70% and you need 90%+
GAIL RL with reward from discriminator trained on demos No reward engineering When reward is hard to specify
DAgger IL with online data collection from expert Fixes compounding error When BC diverges at test time
Residual RL Base IL policy + RL residual corrector Safe exploration near IL behavior 精度 refinement of IL policies

成本和时间表的比较

除了技术优点之外,RL和IL之间的实际决定往往归结为项目时间表和预算.

Resource IL (ACT, 500 demos) RL (PPO in Isaac Lab) Hybrid (IL + Residual RL)
Upfront engineering 1-2 weeks (pipeline setup) 2-4 weeks (sim setup + reward eng.) 3-5 weeks (both pipelines)
Data/experience collection 1-2 weeks (500 demos at 40/hr) 0 (automated in sim) 1 week (200 demos)
Training time 3-4 hours (RTX 4090) 8-24 hours (A100) 4 hr IL + 8 hr RL
GPU compute cost $5-15 $30-100 $35-80
Hardware access cost $800-2,000 (lease + operator) $0 (sim only until validation) $400-1,000
Total timeline 2-4 weeks 4-8 weeks 4-6 weeks
Typical success rate 80-90% 70-85% (after sim-to-real) 85-95%

关键的结论:IL对于大多数操纵任务来说是更快,更便宜的.IL不能达到所需的性能水平,任务不能被证明,或者需要超越人力水平的性能时,RL是合理的.混合方法提供了最高的成功率,但需要投资于两条管道.

选择方法时常犯的错误

错误1:从RL开始,因为它听起来更复杂. ML背景的团队通常默认使用RL,因为这是技术上更有趣的方法.但对于大多数实践操作任务,IL更快地产生更好的结果.从IL开始,只要IL达到清晰的性能上限,就能转向RL.

误差2:在奖励工程中投资不足. 如果您选择RL,请至少为奖励函数设计和代您的工程时间的40%预算.奖励函数是RL管道中最关键的组成部分,并且需要广泛的实验. 差的奖励产生了利用奖励的政策,而不是解决任务的方法.机器人发现了创造性的方法来最大化数量,

**误差3:忽略了真实与真实之间的差距.**在模拟中训练有素的RL政策通常在真实机器人中实现了95%+的成功,但在没有域名随机化的情况下达到40-60%.为域名随机化预算时间和计算,并且在声称成功之前始终验证真实硬件上的真实训练的政策.查看我们的 [伊萨克实验室指南]T2) 域名随机化设置.

**错误4:在IL期间不收集故障数据.**运营商默认地丢弃故障示范.但如我们 [数据质量指南]T3所讨论的),标签的故障示范对于训练恢复行为和故障检测有价值.

任务类型的建议

Task Type Recommended Approach Reason
Pick-and-place (varied poses) IL (ACT or Diffusion) Easily demonstrated, contact minimal
精度 peg insertion IL or IL + Residual RL Demonstrable; RL refines final alignment
Dexterous in-hand manipulation RL (in sim) + IL for initialization Hard to demonstrate; RL finds solutions
Long-horizon assembly (10+ steps) Hierarchical: task planner + IL per step Neither alone handles long horizon well
Locomotion gait optimization RL Non-demonstrable, clear energy reward
Tool use (novel tools) IL for known tools, RL generalization Few-shot IL + sim RL exploration

对于RL训练,RCSV的[RL环境服务]T4) 提供了模拟设置,我们的[数据服务]T5) 处理了IL示范收集--通常用于上述混合方法的组合.

相关阅读

  • [开始与NVIDIA艾萨克实验室]T6) -- 主要平台 GPU加速RL训练
  • 培训与ACT和传播政策相关的IL政策
  • [零射击与少射击机器人政策]T8) - - 基础模型作为RL和IL的替代品从零开始
  • [机器人数据收集成本]T9) -- 关于IL示范收集的预算规划
  • [什么是好机器人培训数据?]
  • RCSV RL环境服务 -- 预先配置的RL培训模拟
  • 数据服务 --对混合管道IL侧进行管理的IL示范收集

需要帮助选择正确的方法吗?

我们可以帮助设计出适合您的任务的管道.

[探索我们的服务]