机器人政策学习的样本效率:你真的需要多少个示范?
分析任务,算法和机器人类型的示范样本效率 <unk>,提供实际指导,用于预算数据收集.
错误判断样本要求是失败机器人学习计划的最常见原因
样本效率问题
训练机器人政策需要多少次示范?诚实答案是:它取决于
这项分析汇总了从出版的机器人学习论文和RCSV内部收集计划的经验结果,以提供关于演示预算的实际指导.
经验数据:算法和任务所需的示范
下列范围来自标准化评估协议的发表结果. "成功率"指每个工作中报告的主要任务指标.
| Algorithm | Task Type | Demos for ~70% SR | Demos for ~85% SR | Notes |
|---|---|---|---|---|
| Behavioral Cloning (ResNet) | Simple single-object grasp | 50–100 | 150–200 | Plateaus early; limited generalization |
| ACT (Action Chunking) | Bimanual pick-and-place | 50–150 | 200–500 | Strong for precise, short-horizon tasks |
| Diffusion Policy | 精度 assembly | 200–500 | 800–2000 | Best for multi-modal behavior |
| Foundation model fine-tune | Novel grasp variants | 20–100 | 200–500 | Requires pretrained visual encoder |
| OpenVLA fine-tune | Language-conditioned manipulation | 50–200 | 300–800 | Generalizes across objects with diverse data |
| From-scratch VLA | Broad manipulation suite | 20,000+ | 50,000+ | Not practical per-task; amortized across tasks |
关键提示:基础模型细调 (从预训练的VLA或视觉编码器开始) 比从头开始训练相同任务的样本效率高3
任务难度乘法
上面的数字假设是1级任务难度.实际任务几乎从来不是1级.
| Level | Task Description | Demo Multiplier | Example |
|---|---|---|---|
| L1 | Simple, fixed-position, single object | 1× | Pick block from fixed location |
| L2 | Variable position/orientation, single object | 2–5× | Pick block from random position in 10cm radius |
| L3 | Multi-step, 2–3 subtasks | 5–20× | Pick block, place on target, press confirm button |
| L4 | Contact-rich, precision required | 20–100× | Peg insertion, drawer opening, plug connection |
| L5 | Deformable objects or bimanual dexterous | 100×+ | Fold cloth, bimanual tool use |
一项看起来像"简单的抓住"的任务,但需要在50种不同物体类型上工作,具有多样化的几何学,是L2
算法效率比较
| Algorithm | Relative 样本效率 | Inference Speed | Best For |
|---|---|---|---|
| BC-RNN | Low (1×) | Fast (< 5ms) | Simple tasks, constrained compute |
| ACT | High (5–10×) | Medium (10–20ms) | Precise bimanual, short-horizon |
| Diffusion Policy | Medium (3–7×) | Slow (50–200ms) | Multi-modal, contact-rich |
| π0 / foundation model fine-tune | Very high (10–20×) | Slow (100–500ms) | Broad generalization, novel objects |
| From-scratch CNN-多层感知器 | Very low (0.5×) | Very fast (< 2ms) | Constrained robots, simple tasks only |
实际预算指南
在承诺全面收费计划之前,对演示预算进行系统化方法:
- **步骤1
试点收集:**收集精确的200个示例.这是任何现代算法的非微不足道任务的最低可行的数据集. - **步骤 2
训练和测量:**在200个演示中训练目标算法. - **步骤3
学习曲线抽象:**如果200个演示给你S%的成功率,你的目标是T%,则根据一个定数曲线来估计所需的总演示. - 步骤4
算法重评: 如果你的200个演示成功率低于40%,在投资更多数据之前,考虑切换算法或添加预训练有素的视觉编码器.200个演示的弱信号通常表明算法与任务不匹配,而不是数据量问题. - **第5步
飞行车预算:**计划初始收集50 60%的预计总需求.在初始部署后保留剩余的预算用于故障目标收集.故障目标数据比随机收集更有效,以缩小最终性能差距.
减少回报率:学习曲线的
每个学习曲线都有一个"膝盖"
在膝盖以下,每一批100个示例都会产生3
预算
对于需要90%以上的任务 (安全关键操作,医疗器械组装),最终5
RCSV 的 [数据收集服务]
获得你的任务演示预算估计
斯威尔士国家机器人科学团队为新的机器人学习计划提供免费的演示预算估计,包括算法建议和学习曲线预测.
[要求数据估计]







