机器人操纵的模仿学习:一个决策指南
什么时候使用强化学习与模仿学习培训机器人操纵政策 任务类型,数据可用性和计算预算.
部分: [模仿学习指南]
[←博客]
选择RL和IL不是关于哪个更好
快速决定的规则
在详细分析之前:如果您可以轻松地通过远程操作系统证明任务,请使用模仿学习.如果您无法证明它,但可以定义一个清晰的尺度奖励信号,请使用RL.如果没有任何一个都适用,任务太复杂了
这一规则适用于80%的实践操纵场景,剩余20%需要混合方法或仔细分析下面的权衡.
模仿学习:优势和局限性
常被低估的优势:
- **快速发展周期:**100次示范 →经过2~4小时的培训政策.
- ** 建筑安全:** 政策学会保持在已被证明的行为附近. 它不会像RL探险家那样发现危险的边缘事件.
- 没有奖励工程: 定义一个精确组装的奖励函数是惊人的困难.
- **可预测成本:**每次性能改善的成本是线性和可测量的
收集更多的100个演示,预计N%的改善.
- 由示范人员质量限制: 该政策不能超过示范人员的技能.
- ** 组合错误:** 行为克隆从长时间水平上从训练分布中转移.
- 不能发现不明显的解决方案: 如果有一个难以证明但易于执行的策略 (例如,使用惯性动力来将物体扔进垃圾桶),IL将永远不会找到它.
加强学习:优势和局限性
- **可以超越人类的性能:**RL在游戏中发现了超人策略,并发现了对特定物体的非直观但优越的把握策略.
- **处理不可证明的行为:**人类无法轻松控制机器人 (高速动态,复杂的接触序列) 的任务是自然的RL目标.
- 长远规划: 通过有形好的奖励,RL可以处理20-50步骤的任务,这些任务容易导致IL的错误.
经常低估的RL限制:
- **样本效率:**现代操作RL需要500K-5M环境步骤进行简单的任务.在10Hz模拟时,这相当于14-14小时的模拟时间
,大小数量比IL更多的数据. - 奖励工程难度: 节省奖励 (仅成功/失败) 很少没有仔细的塑造工作.对操纵的密集奖励功能很难正确地指定.错误的塑造的奖励产生利用奖励而不是解决任务的政策.
- **实体机器人上的真实世界RL可能但慢而昂贵.RL几乎总是需要模拟,这需要sim-to-real转移.
面对面的比较
| Dimension | 模仿学习 | Reinforcement Learning |
|---|---|---|
| Sample efficiency | 100-500 demos for most tasks | 500K-5M sim steps (much more data) |
| Reward design needed? | No (demonstrations are the reward) | Yes (hardest part of the pipeline) |
| Simulation required? | No (works on real robot directly) | Practically yes (real-world RL is too slow) |
| Hardware access needed? | Yes (physical robot + teleoperation) | Only for validation (training is in sim) |
| GPU compute cost | $5-50 per policy (2-12 hr training) | $50-500 per policy (8-100 hr training) |
| Performance ceiling | Bounded by demonstrator skill | Can exceed human performance |
| Safety during training | Inherently safe (follows demo distribution) | 探索 can be dangerous on real hardware |
| Time to first policy | 1-3 days (collect + train) | 1-4 weeks (sim setup + training) |
| Sim-to-real gap? | No (trained on real data) | Yes (major challenge for deployment) |
| Multi-task scaling | Linear cost per task (need demos for each) | Reward re-engineering per task (often harder) |
决策流程图
按照这个问题序列来确定您的具体任务的正确方法:
- 如果是,IL是你的起点.如果没有 (例如,任务需要超人速度,反应时间或自由控制程度),请进入步骤3.
- **任务是否需要超出示范人员能力的精度?**如果IL政策达到70-80%,但你需要95%+的成功,请使用IL热启动+RL精炼 (混合).如果IL独自达到目标,请停止.
- 您可以定义任务的 skalar 奖励函数吗? 如果是的,并且您可以访问模拟,请使用 RL. 如果奖励是模糊的或多目标的,请考虑 GAIL (使用示范来学习奖励) 或将任务分为更明确的奖励子任务.
- **如果任务涉及具有已知几何学的硬体,则通常是可行的.如果涉及可变形的物体,流体或复杂的接触动态,则sim fidelity可能不足 - - 默认在实际硬件上IL.
- 您的计算预算是多少? 如果您可以访问A100/H100GPU,并且可以承担10-100小时的培训时间,RL是实用的. 如果您的计算量有限 (单个RTX 3090或云现场实例),IL的计算效率是10-100倍.
混合方法:两种方法最好
| Approach | Description | Benefit | When to Use |
|---|---|---|---|
| IL warm-start + RL fine-tuning | Train IL policy first, use as RL initialization | 10× more efficient RL | When IL policy is 60-70% and you need 90%+ |
| GAIL | RL with reward from discriminator trained on demos | No reward engineering | When reward is hard to specify |
| DAgger | IL with online data collection from expert | Fixes compounding error | When BC diverges at test time |
| Residual RL | Base IL policy + RL residual corrector | Safe exploration near IL behavior | 精度 refinement of IL policies |
成本和时间表的比较
除了技术优点之外,RL和IL之间的实际决定往往归结为项目时间表和预算.
| Resource | IL (ACT, 500 demos) | RL (PPO in Isaac Lab) | Hybrid (IL + Residual RL) |
|---|---|---|---|
| Upfront engineering | 1-2 weeks (pipeline setup) | 2-4 weeks (sim setup + reward eng.) | 3-5 weeks (both pipelines) |
| Data/experience collection | 1-2 weeks (500 demos at 40/hr) | 0 (automated in sim) | 1 week (200 demos) |
| Training time | 3-4 hours (RTX 4090) | 8-24 hours (A100) | 4 hr IL + 8 hr RL |
| GPU compute cost | $5-15 | $30-100 | $35-80 |
| Hardware access cost | $800-2,000 (lease + operator) | $0 (sim only until validation) | $400-1,000 |
| Total timeline | 2-4 weeks | 4-8 weeks | 4-6 weeks |
| Typical success rate | 80-90% | 70-85% (after sim-to-real) | 85-95% |
关键的结论:IL对于大多数操纵任务来说是更快,更便宜的.IL不能达到所需的性能水平,任务不能被证明,或者需要超越人力水平的性能时,RL是合理的.混合方法提供了最高的成功率,但需要投资于两条管道.
选择方法时常犯的错误
错误1:从RL开始,因为它听起来更复杂. ML背景的团队通常默认使用RL,因为这是技术上更有趣的方法.但对于大多数实践操作任务,IL更快地产生更好的结果.从IL开始,只要IL达到清晰的性能上限,就能转向RL.
误差2:在奖励工程中投资不足. 如果您选择RL,请至少为奖励函数设计和
**误差3:忽略了真实与真实之间的差距.**在模拟中训练有素的RL政策通常在真实机器人中实现了95%+的成功,但在没有域名随机化的情况下达到40-60%.为域名随机化预算时间和计算,并且在声称成功之前始终验证真实硬件上的真实训练的政策.查看我们的 [伊萨克实验室指南]
**错误4:在IL期间不收集故障数据.**运营商默认地丢弃故障示范.但如我们 [数据质量指南]
任务类型的建议
| Task Type | Recommended Approach | Reason |
|---|---|---|
| Pick-and-place (varied poses) | IL (ACT or Diffusion) | Easily demonstrated, contact minimal |
| 精度 peg insertion | IL or IL + Residual RL | Demonstrable; RL refines final alignment |
| Dexterous in-hand manipulation | RL (in sim) + IL for initialization | Hard to demonstrate; RL finds solutions |
| Long-horizon assembly (10+ steps) | Hierarchical: task planner + IL per step | Neither alone handles long horizon well |
| Locomotion gait optimization | RL | Non-demonstrable, clear energy reward |
| Tool use (novel tools) | IL for known tools, RL generalization | Few-shot IL + sim RL exploration |
对于RL训练,RCSV的[RL环境服务]
相关阅读
- [开始与NVIDIA艾萨克实验室]
T6 ) -- 主要平台 GPU加速RL训练 - 培训与ACT和传播政策相关的IL政策
- [零射击与少射击机器人政策]
T8 ) - - 基础模型作为RL和IL的替代品从零开始 - [机器人数据收集成本]
T9 ) -- 关于IL示范收集的预算规划 - [什么是好机器人培训数据?]
- RCSV RL环境服务 -- 预先配置的RL培训模拟
- 数据服务 --对混合管道IL侧进行管理的IL示范收集
需要帮助选择正确的方法吗?
[探索我们的服务]







