返回Research

机器人政策学习的样本效率:你真的需要多少个示范?

分析任务,算法和机器人类型的示范样本效率 <unk>,提供实际指导,用于预算数据收集.

错误判断样本要求是失败机器人学习计划的最常见原因,并且完全可以预防.

样本效率问题

训练机器人政策需要多少次示范?诚实答案是:它取决于,范围范围范围为四个大小.一个单个对象的简单掌握可以从50次示范中学习.从零开始训练视觉语言行动模型需要5万或更多. 在启动数据收集计划之前误判这一点导致两个失败模式之一:不足收集 (政策从来没有融合) 或过度收集 (预算浪费于冗余的数据).

这项分析汇总了从出版的机器人学习论文和RCSV内部收集计划的经验结果,以提供关于演示预算的实际指导.

经验数据:算法和任务所需的示范

下列范围来自标准化评估协议的发表结果. "成功率"指每个工作中报告的主要任务指标.

Algorithm Task Type Demos for ~70% SR Demos for ~85% SR Notes
Behavioral Cloning (ResNet) Simple single-object grasp 50–100 150–200 Plateaus early; limited generalization
ACT (Action Chunking) Bimanual pick-and-place 50–150 200–500 Strong for precise, short-horizon tasks
Diffusion Policy 精度 assembly 200–500 800–2000 Best for multi-modal behavior
Foundation model fine-tune Novel grasp variants 20–100 200–500 Requires pretrained visual encoder
OpenVLA fine-tune Language-conditioned manipulation 50–200 300–800 Generalizes across objects with diverse data
From-scratch VLA Broad manipulation suite 20,000+ 50,000+ Not practical per-task; amortized across tasks

关键提示:基础模型细调 (从预训练的VLA或视觉编码器开始) 比从头开始训练相同任务的样本效率高310倍.如果你的任务与开放X-Embodiment或OXE衍生模型所涵盖的任务有任何视觉相似性,细调几乎总是正确的出发点.

任务难度乘法

上面的数字假设是1级任务难度.实际任务几乎从来不是1级.

Level Task Description Demo Multiplier Example
L1 Simple, fixed-position, single object Pick block from fixed location
L2 Variable position/orientation, single object 2–5× Pick block from random position in 10cm radius
L3 Multi-step, 2–3 subtasks 5–20× Pick block, place on target, press confirm button
L4 Contact-rich, precision required 20–100× Peg insertion, drawer opening, plug connection
L5 Deformable objects or bimanual dexterous 100×+ Fold cloth, bimanual tool use

一项看起来像"简单的抓住"的任务,但需要在50种不同物体类型上工作,具有多样化的几何学,是L2L3任务,而不是L1.大多数工业操纵任务是L2L3.

算法效率比较

Algorithm Relative 样本效率 Inference Speed Best For
BC-RNN Low (1×) Fast (< 5ms) Simple tasks, constrained compute
ACT High (5–10×) Medium (10–20ms) Precise bimanual, short-horizon
Diffusion Policy Medium (3–7×) Slow (50–200ms) Multi-modal, contact-rich
π0 / foundation model fine-tune Very high (10–20×) Slow (100–500ms) Broad generalization, novel objects
From-scratch CNN-多层感知器 Very low (0.5×) Very fast (< 2ms) Constrained robots, simple tasks only

实际预算指南

在承诺全面收费计划之前,对演示预算进行系统化方法:

  • **步骤1 试点收集:**收集精确的200个示例.这是任何现代算法的非微不足道任务的最低可行的数据集.
  • **步骤 2 训练和测量:**在200个演示中训练目标算法.
  • **步骤3 学习曲线抽象:**如果200个演示给你S%的成功率,你的目标是T%,则根据一个定数曲线来估计所需的总演示.
  • 步骤4 算法重评: 如果你的200个演示成功率低于40%,在投资更多数据之前,考虑切换算法或添加预训练有素的视觉编码器.200个演示的弱信号通常表明算法与任务不匹配,而不是数据量问题.
  • **第5步 飞行车预算:**计划初始收集5060%的预计总需求.在初始部署后保留剩余的预算用于故障目标收集.故障目标数据比随机收集更有效,以缩小最终性能差距.

减少回报率:学习曲线的

每个学习曲线都有一个"膝盖",边际回报率大幅下降的折叠点.在30多个收集程序中的实验数据中,膝盖始终出现在任务实验最大成功率的7080%上.

在膝盖以下,每一批100个示例都会产生38%的成功率改善.在膝盖上,每一个5%的改善需要310x与前5%的改善相同的示例.

预算预计需要5001,500个针对性示范,以弥补这5点差距,而不是100点差距.

对于需要90%以上的任务 (安全关键操作,医疗器械组装),最终510%的性能成本通常高于达到85%的成本.

RCSV 的 [数据收集服务]T1) 包含学习曲线估计作为每个程序开启的一部分.我们的 [无畏平台]T2) 实时跟踪您的学习曲线,自动标记您跨越膝盖时并激活失败目标收集模式.

获得你的任务演示预算估计

斯威尔士国家机器人科学团队为新的机器人学习计划提供免费的演示预算估计,包括算法建议和学习曲线预测.

[要求数据估计]