设计机器人学习课程:任务序列和难度进展
如何设计机器人学习课程 <unk>从简单到复杂的任务序列,示范要求,转移学习策略.
通过复杂的多步骤操纵从原始技能获得到模仿学习的课程设计的结构化方法.
为什么课程很重要
开始一个具有复杂任务的机器人学习计划是团队犯的最常见和最昂贵的错误.直接训练在复杂任务上,如从零开始折叠双手布这样的政策将在前2000次示范中没有学习任何有用的东西.任务空间太大,奖励信号太稀缺,网络没有先前的技能来建立.
设计好的课程将从原始技能到复杂的组合的任务进行序列,每个阶段都基于前阶段获得的技能. 在RCSV使用课程学习的团队,与直接端到端培训相比,对复杂操纵任务的总示范要求减少了40-60%.
机器人学学理论被正式化为课程学习 (Bengio等,2009):通过增加难度来排序的例子的训练,即使与相同的总训练数据,也会产生更好的概括,而不是随机排序.
机器人学习理论
在机器人操纵环境中学习课程基于三个理论支柱,每个支柱对如何排序任务和分配示范预算有实际影响.
很容易做订单
基本原则:首先提出更容易的任务,逐渐引入更难的变体.对于操纵,"轻松"意味着更少的接触过渡,更短的视界,更少的视觉变化和更有限的初始条件.
- 固定位置抓住
物体总是处于相同的姿势,相同的照明,相同的背景. - ** 随机对象位置在20厘米×20厘米区域内. 政策学习位置不变.
- 选择,运输,地点,多个状态转变.
- 接触式任务
插入,组装,强力敏感操作.
提前提前浪费示范,在一个缺乏有效学习更难任务的政策上.
自动课程方法
随着学习的过程,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程中,学习的过程
| Method | How It Works | Best For | Limitation |
|---|---|---|---|
| Self-paced learning | Up-weight training samples where the policy's loss is low (already learned) or in a "learning zone" (moderate loss) | Large, heterogeneous demonstration datasets | Requires all data upfront; no active collection |
| Competence-based progression | Evaluate policy on current stage every N episodes; advance when success rate > threshold | Active data collection pipelines (RCSV default) | Requires evaluation infrastructure between stages |
| Hindsight relabeling | Failed demonstrations are relabeled as successes for easier goals (e.g., "reach to where the object ended up") | Goal-conditioned policies; RL fine-tuning | Not directly applicable to pure IL without RL component |
| Domain randomization scheduling | Gradually increase visual/physical randomization range during training | Sim-to-real transfer; robustness training | Requires simulation environment |
在实践中,RCSV在积极的数据收集项目中使用基于能力的进步:在当前的课程阶段收集示范,训练,评估,并在达到成功门
失败情况注射
只有成功的示范的课程产生了脆弱的政策.当部署的政策遇到一个新情况,并且部分失败时,它从未见过恢复轨迹,并且进入了无法分配的状态,通常会导致完全失败.
故意故障注射在每个课程阶段包括10-20%的故障和恢复示范:
- **抓获失败:**运营商故意执行弱抓,检测滑动,再抓.政策学习滑动检测和恢复.
- **位置错误:**操作员接近对象稍微偏离中心,在中途调整.
- 物体扰乱: 操作员在接近过程中移动物体.操作员重新规划. 政策学习反应性重新规划.
- **部分完成任务:**操作员完成了70%的任务,对象下降,操作员恢复并完成.
在L1 (固定原始) 中,故障很少发生,并不是信息性的.在L2+中,故障恢复是一种关键技能,显著提高了生产稳定性.
课程设计原则
- 从原始技能开始 (到达,抓住):"到达对象"政策和"抓住稳定的对象"政策是几乎所有操纵任务的基础.
- 将这些任务分为复杂任务: 一旦培养原始技能,复杂任务就会更快地学习,因为政策已经具有相关的感知和运动分技能.在达到和抓住政策后训练的"把杯子放在托盘上"任务只需要300-500次演示才能学习组合;从零开始训练需要2000-5.000.
- **跨任务重复使用示范:**原始技能示范可作为所有需要这些技能的任务预训数据重复使用.
- **严格衡量原始技能质量:**原始技能只能在80%的时间内发挥作用,在复合任务中会恶化.
任务分解策略
任何复杂的操纵任务都可以分解成一系列原始行动.分解决定了你如何结构化课程,分配示范预算和制定政策.
战略1:序列原始 (最简单)
按明确交付条件执行的原始函数的固定序列,
- 示例:
杯堆 REACH(cup_A) → GRASP(cup_A) → TRANSPORT(cup_A,上面_cup_B) → PLACE(cup_A,上面_cup_B) →释放: - 交换条件: 每个原始表示成功条件 (例如,抓紧关闭和抓紧力为GRASP>2N).
- 优点: 易于调试 (故障是局部化到一个原始),每个原始可以独立训练,原始可以重复使用.
- 限制: 严格的测序不能处理顺序依赖环境的任务,或者原始的时间重叠.
战略2:层次政策 (中等)
根据当前的观察,一个高级别政策选择了执行的原始.原始人是预先训练的,只有高级别政策才会接受全面的训练.
- 示例
排序任务: 高级政策观察现场,确定下一个进行排序的对象,并选择REACH → GRASP → PLACE_BIN_A或REACH → GRASP → PLACE_BIN_B. - 培训: 独立预训练所有原始人 (课程阶段L1-L2). 然后,训练高级别的政策,并展示完整的分类任务,而高级别的操作是原始的选择,而不是原始的联合命令.
- 技术的发展,技术的发展,技术的发展,技术的发展,技术的发展,技术的发展,技术的发展,技术的发展,技术的发展,技术的发展,技术的发展,技术的发展,技术的发展,技术的发展,技术的发展,技术的发展,技术的发展,技术的发展,技术的发展,技术的发展,技术的发展,技术的发展,技术的发展,技术的发展,技术的发展,技术的发展,技术的发展,技术的发展,技术的发展,技术的发展,技术的发展,技术的发展,技术的发展,技术的发展.
战略3:课程预训的终端到终端 (最灵活)
训练一个单一的端到端政策,完成全部任务,但从原始技能训练开始视觉编码和动作解码权重.
- 过程: (1) 训练原始,提取视觉编码器重量. (2) 用原始编码器启动全任务政策. (3) 精细调整全任务的示范.
- 优势: 没有明确的交付条件;政策学习隐含的转变.
- 限制: 需要比战略2更多的全任务演示.
任务难度级别 L1-L5
| Level | Task Description | Examples | Demo Requirement | Key Challenge |
|---|---|---|---|---|
| L1 — Primitive single-step | Top grasp of flat, stationary object in fixed position | Pick flat block, open/close gripper on fixed peg | 50-200 | Precise approach trajectory |
| L2 — Varied grasp | Grasp objects with varied size, position, or orientation | Pick cylinder of varying diameter, grasp in +/-30 deg orientation range | 500-1,000 | Visual generalization |
| L3 — Two-step manipulation | Sequential actions with state dependency | Pick and place, open box lid then insert item | 1,000-5,000 | State estimation between steps |
| L4 — Contact-rich assembly | Precise insertion, assembly under uncertainty | USB plug insertion, snap-fit assembly, nut threading | 5,000-20,000 | Reactive force control |
| L5 — Bimanual deformable | Two arms, deformable objects, long horizons | Fold towel, bag groceries, cut with knife and fork | 20,000+ | Bimanual coordination, deformable state |
这些范围假设现代基于变压器的模仿学习架构 (ACT,扩散政策).较老的行为克隆方法需要为同一任务进行2-5倍的示范.如果你使用pi-0或一个大预训练的视觉语言行动模型这样的新架构,由于预训练的先例,L1-L3的示范要求可能会减少3-10倍.
演示数量按课程阶段进行扩展
演示预算应遵循课程阶段的非线性扩展模式.第一阶段需要相对少的演示,但由于任务复杂性增加,每次演示阶段都需要更多的演示.
| Curriculum Stage | Demos (Without Curriculum) | Demos (With Curriculum) | Savings | Success Threshold to Advance |
|---|---|---|---|---|
| L1 — 工作范围 + grasp (fixed) | 100-200 | 100-200 | 0% (baseline) | 95% |
| L2 — Varied grasp | 500-1,000 | 300-600 | 30-40% | 90% |
| L3 — Pick-place sequence | 2,000-5,000 | 800-2,000 | 50-60% | 85% |
| L4 — Contact assembly | 10,000-20,000 | 4,000-8,000 | 50-60% | 80% |
| L5 — Bimanual deformable | 20,000-50,000 | 8,000-20,000 | 50-60% | 75% |
基本的见解:课程节省率最高在L3-L5,正是示范成本最高的地方.每次示范25-$80 (RCSV数据服务定价)
操纵课程:选择,堆,插入
工作例显示了生产组装任务的完整课程:将部件插入住房. 最后的任务是L4 (接触丰富的插入),但课程首先通过L1-L3阶段构建.
阶段1: 达到组件 (L1) - 150个演示
训练手臂从主位置移动到部件高于部件3厘米的预抓姿势.固定部件位置,固定照明.成功:在目标预抓姿势5毫米内的终端效应器.
- 硬件: OpenArm 1 (6-DOF,500g的有效载荷) 附着RealSense D405手腕安装
- 数据速率: 30 Hz 关节位置 + 60 fps RGB 从手腕摄像头
- 输出格式:HDF5与 /observations/qpos [6], /observations/images/cam_wrist [480x640x3], /action [6]
- 评估:20次试验,目标>95%成功
阶段2: 抓取组件 (L2) - 400个演示
扩展从预抓到闭住. 组件位置在15厘米×15厘米内变化. 三个组件尺寸 (小,中,大).成功:稳定抓通过5厘米的升起而无下降来验证.
- 从阶段1重量开始视觉编码器
- 包含10%的抓不住和抓不住示范
- 评估:所有变体中50次试验,目标>90%成功
阶段3:交通与协调 (L3) - 800个演示
选择组件,运送到
- 从阶段2重量开始 (编码器 + 动作解码器)
- 隔离位置在10cm x10cm内不同
- 包含15%的离中心的方法和正确示范
- 评估:50次试验,目标>85%成功
阶段4:插入组件 (L4) - 2,000个演示
完成插入,并调节力. 加入F/T传感器数据到观测空间. 成功:部件完全坐下 (F/T传感器检测到坐下力签名).
- 从3级重量开始;将F/T观察分支添加到网络中
- 通过 [手腕F/T传感器]
T3 ) 收集在100Hz,同时在30Hz的视力 - 包含20%的恢复示范:错误的方法,通过力反
进行纠正 - 评估:100次试验,目标>80%成功
课程共计: 3,350次演示. 课程不含的总数: 10,000-20,000次演示. 节省成本40美元/演示:266万至666万美元.
每个阶段的评估指标
每个课程阶段都需要特定的评估指标,不仅仅仅是成功/失败.这些指标可以诊断政策是否准备好进步或需要更多数据.
| Metric | What It Measures | Target | Stage Applicability |
|---|---|---|---|
| Success rate | Binary task completion | 75-95% (by stage) | All stages |
| 轨迹 smoothness (jerk) | Third derivative of joint positions; lower = smoother | <2x demonstration average | L1-L3 |
| Positional accuracy | End-effector error at target pose | <5 mm for L1-L2, <2 mm for L3-L4 | L1-L4 |
| 情节 duration variance | Consistency of task execution timing | CV < 0.3 | L2-L5 |
| Force regulation error | Deviation from target contact force | +/- 1 N of target | L4-L5 only |
| Bimanual sync error | Timing offset between left and right arm actions | <50 ms | L5 only |
| 泛化能力 gap | Success rate on held-out object positions vs. training positions | <10% drop | L2-L5 |
将所有评估数据上传到 [RCSV数据平台]
技能分解的例子
举个例子,一个杯子堆
- ** 达到技巧:** 移动终端效应器到杯手柄区域内2厘米,准确的接近角. 独立训练100-200个演示.可用于任何杯手抓任务.
- 抓握技巧: 通过抓握位置反
来验证抓握成功. 训练用50-100个演示 (从抓握技巧权重开始). 可用于所有杯处理任务. - ** 设置技能:** 降低杯子到目标杯子,对齐中心,释放抓. 创新技能在杯子堆
. 需要300-500个演示,接受到达+抓取预训练. 没有预训练:1,500-2,500个演示.
课程: 450-800个示范.课程不含的总数: 2,000-5,000个示范.课程减少了这项任务的数据需求4-6倍.
任务之间转移学习
现代政策架构在观测空间中共享视觉编码器.这个编码器学习从图像中提取与任务相关的功能.当你通过课程训练编码器进行各种任务时,它会开发更丰富的表示,更有效地转移到新任务.
- 共享视觉编码器: 共同训练一个单个ResNet-18或ViT小编码器在所有课程任务上.这个编码器学习"对象边缘","抓紧器接近"和"抓紧接触"等功能,这些功能在许多任务中都有用.
- **3x样本效率与课程:**经验上,一个课程预先训练的视觉编码器将新型L3任务的示范要求从2000个演示到大约600-700个演示
大约提高了样本效率3倍. - **精确调节策略:**对于一个新任务,将编码器重量从课程中
结 (或使用低学习率),并仅训练操作解码器在新任务的演示上. 这可以防止学习新任务时灾难性地忘记以前的技能.
什么时候跳过课程
课程设计需要时间,而且只能为复杂的任务付出代价.
- L1-L2任务:直接进行. 简单单单步骤或多种手
任务可以在100-1000个演示中进行端到端培训. - **L3任务:情况依赖.***如果你有明确的技能分解,并且已经从另一个项目中获得原始技能数据,请使用课程.
- L4-L5任务:课程是必不可少的. 试图从零开始直接培训接触丰富的组装或双手任务,而没有课程,是昂贵的,通常是失败的.在这个水平上,课程设计的努力是充分合理的.
- 使用预训练的VLA: 如果您正在精细调制预训练的视觉语言行动模型 (RT-2,Octo,pi-0),该模型已经具有显著的预先知识.课程可能仍然有帮助,但基线性能要高得多,减少差距.
数据收集顺序
收集课程顺序的数据
- 首先收集L1数据: 训练L1政策达到95%的成功.这些政策现在可以自主收集L2/L3数据收集的方法轨迹 (运营商修改接近接触,而不是完全的方法).
- **使用训练有素的数据增强政策:**训练有素的接触政策可以自主执行接近阶段,而人类操作员从抓取阶段开始进行远程操作. 这减少了操作员的认知负载,并产生了更一致的示范.
- 在早期阶段优先考虑一致性与速度: L1和 L2示范应缓慢和故意执行.政策将从数据中学习近似速度
慢,清晰的示范比易分解的快速示范更有信息性. - ** 间歇训练和收集:** 每100-200次示范后,训练一个检查点并评估. 如果政策停滞不前,则收集更多的多样性示范 (新物体位置,照明条件) 而不是简单地更多的相同.
课程设计检查清单
- 精确定义最终目标任务及其成功标准
- 从L1到目标水平分为3-5个课程阶段
- 具体说明每个阶段的示范计数预算 (使用上述扩展表)
- 确定每个阶段的评估指标和进步门
- 计划失败注射率为L2及以上阶段 10-20%
- 在收集开始之前设置[数据平台]
T5 ) 进行每阶段跟踪 - 拨款20%的预算作为预备,用于需要比计划更多的示范阶段
- 计划编码器重量转移策略 (结结与细调)
- 计划操作员在每个阶段之前培训具体任务要求
- 建立一个审查序列:每200次演示,不仅仅在阶段结束时评估检查点
相关指南
- [机器人数据收集服务买方指南]
T6 ) 评估课程规模项目数据提供商 - [数据格式指南 (HDF5/RLDS/LeRobot) ]
T7 ) 确保课程数据存储在兼容的格式中 - 双手机远程操作硬件设置
L5课程任务的硬件 T9 ) 建立团队来执行你的课程 - [力/扭矩传感器选择指南]
T10 ) 增加L4+课程阶段的F/T传感器 - [如何设置远程操作实验室]
T11 ) 数据收集实验室基础设施
与RCSV合作
通过L1单步抓到L5双手形形形象操纵,我们的团队设计和执行了操纵任务的课程.
- 课程咨询: 在开始收集数据之前,我们会审查您的目标任务,提出课程结构,并估计示范预算.
- **数据收集执行:**我们在 [旧金山,加州]
T12 ) 和 [阿尔斯顿,马萨克里斯加州] T13 ) 设施的认证运营商收集了课程阶段数据在 [OpenArm 1] T14 ),DK1双手册,Unitree G1和5+其他手臂平台. - **平台集成:**所有收集的数据都将上传到 RCSV数据平台 包含每个阶段的指标,评估仪表板和格式向 HDF5/LeRobot/RLDS出口.
- **硬件租
:**需要硬件来执行内部课程吗?
建立你的训练数据集
对于机器人学习团队,RCSV数据服务提供了课程知情的数据收集基础设施,运营商培训和数据集质量分析.







