零射击与少射击机器人政策:设定现实的预期
诚实评估2025年零射击和少射击机器人政策的表现 <unk>什么是可实现的,在哪些任务上,
[←博客]
无射机器人是真实的
定义
零射意味着执行一个新任务或处理一个新的对象,没有新的示范. 机器人完全依赖于预训练期间所学到的东西. 少射意味着适应一个新的任务,有5-50个新的示范.这些功能是有意义的不同的,并将它们结合导致不切实际的规划.
零射击现实
基于机器人操纵的基础模型
- 开放词汇物体检测+简单的上下抓计划工作 对于在清晰表面呈现的普通家庭物体中60%的零镜头
- 在以前探索的环境中使用语言调节的导航在结构设置中成功率达75%
- 采用熟悉的物体类别 (
,瓶,块) 的选择和放置实现了标准基准标准的50-65%的成功零射率
零射击可靠地失败时:需要在5mm以下放置的精密任务,巧妙的操纵,使用新型工具,物体呈现非正规的任务 (倾斜瓶子,堆叠杯子),以及任何涉及训练数据中不充分表示的变形物体的任务.
短拍精细调节:更具实用能力
基本模型最明显的实际价值是在很少的细节调整 (20-100次新任务示范).
| Training Approach | Demos Required | Typical Success Rate | Time to Train |
|---|---|---|---|
| Foundation model, zero-shot | 0 | 30–65% (simple tasks) | N/A |
| Foundation model + 20 demo fine-tune | 20 | 70–80% | 30 min GPU |
| Foundation model + 100 demo fine-tune | 100 | 80–90% | 2 hr GPU |
| Train from scratch (ACT) | 500 | 75–88% | 3–4 hr GPU |
| Train from scratch (Diffusion) | 1000 | 82–92% | 8–12 hr GPU |
基础模型的优势最明显在低数据模式 (低于100个示例).在20个示例中,一个精细调整的基础模型实现了与从头开始训练ACT的成功率相比较的成功率.这就是25倍的数据效率提高
现在零射击的实力
- ** 结构化采集,有明确的对象检测:** DETIC + GraspNet式的开放词汇检测 + 简单的抓住计划器在有组织的垃圾箱中对普通物体进行零射.
- **已知空间中的语言调节导航:**VLN (视觉语言导航) 模型在被训练理解的空间中工作零射击,并且对不同建筑物的相同布局空间进行了良好的通用化.
- **按类别识别和排序:**语言条件排序 ("将红色项放在左边的桶里") 对已知类别使用RGB分类工作为零.
没有 (然而)
- 接触式操纵:
入孔, 接头,折叠布料, 脱 杯 零射击成功率为目前的基础模型的10-30%. - 新工具使用: 使用一个不熟悉的工具 (一个开
器,一个特定的螺丝 机) 零射还不可靠. - **外部操纵:**手中重新抓取,使用指控的物体旋转
所有生产模型的零射电流能力之外.
基金会模型基准结果 (2025-2026)
| Model | Provider | Zero-Shot (SimplerEnv) | 20-Shot Fine-Tune | Parameters |
|---|---|---|---|---|
| OpenVLA | Stanford/TRI | 48-62% | 72-80% | 7B |
| Octo | Berkeley | 35-55% | 65-78% | 93M |
| pi-0 | Physical Intelligence | 55-70% | 78-88% | 3B |
| RT-2-X | Google DeepMind | 50-65% | 75-85% | 55B |
| ACT (from scratch) | Stanford | N/A | 40-55% (20 demos) | 12M |
这些数字代表了在控制实验室环境中简单的操纵基准 (选择位置,抽
短拍数据效率曲线
根据公布的结果和RCSV内部评估,
- 5 示范: 基础模型显示了5-15%的改善,比零射击.从零开始的训练产生了不可靠的政策.
- **20次示范:**基础模型细调的最佳点.大多数模型在此点达到70至80%的最终性能.从零开始,ACT通常达到40至55%.预训练和零的差距为20至30个百分点.
- **50个示范:**基础模型接近其顶峰 (80-88%). 零碎训练模型缩小了差距,通过收集良好数据达到60-75%.成本差异很大:50个示范成本为200-500美元,RCSV比较为基础模型投资的几个月的预训练计算.
- **100次示范:**基础模型细调对于大多数任务的回报率降低. 零碎训练模型进一步赶上 (75-85%). 实际问题是,剩余的性能差距是否证明了使用3-7B参数模型进行推断的复杂性.
- 500次示范: 基于零碎训练的ACT和扩散政策通常与精细调整的基础模型相匹配或超过.在这个数据量下,预训练的优势对于单任务部署是最小的.基础模型保留了多任务通用化的优势.
什么时候使用哪种方法:决策矩阵
| Scenario | Recommendation | Why |
|---|---|---|
| Quick feasibility test, simple task | Zero-shot with OpenVLA/pi-0 | No data cost; instant evaluation |
| New task, limited budget (<$2K data) | Foundation model + 20-50 demo fine-tune | Maximum performance per dollar |
| Production deployment, single task | ACT/Diffusion from scratch, 300-500 demos | Smaller model = faster inference, simpler deployment |
| Multi-task deployment (10+ tasks) | Foundation model + per-task fine-tuning | Shared backbone amortizes model cost |
| 精度 task (sub-2mm tolerance) | Scratch Diffusion Policy, 500+ demos | Foundation models lack precision for tight tolerances |
| Edge compute (Jetson, no GPU server) | Small model from scratch (ACT 12M params) | 7B VLA models cannot run on edge devices |
身体的差距:为什么零射击比看起来更难
基于模型规模,NLP的零射击性能可靠地提高:70B语言模型在零射击文本任务上比7B模型一致地更好.同样的扩展关系不适用于机器人基础模型,理解为什么对设置现实的期望至关重要.
基本的挑战是体现差距:与文本不同 (具有普遍的标记化),机器人操作是体现特定的.一个7DOF联合速度命令为Franka Research 3是无意义的6DOF开臂或移动操纵器与不同的动态链. 目前的基础模型通过操作空间正常化 (将所有机器人映射到共享的7DOF表示,这会损失更多或少量的DOF机器人信息) 或实施体现特定输出头 (需要至少对目标实施体现进行几次示范来校准输出头) 来处理这一问题.
这意味着在新的机器人实施例中, "零射击"是功能不可能的 - - 你总是需要至少一个校准步骤.今天运行的零射击能力是零射击在模型训练的相同实施例上新任务.转移到新的实施例总是最小的零射击.
感知差距是第二大挑战.基础模型在特定实验室收集的数据集上训练,使用特定的摄像头,照明和背景.在不同视觉条件的新环境中部署时,视觉编码器的表示变化,降低了政策性能. 这就是为什么发表的零射击数字 (与训练数据相似的实验室收集) 比现实数字高出10-20个百分点.训练期间域名随机定位和视觉语言预训练都有帮助,但今天没有一个完全关闭这一差距.
** 动作分布差距.** 不同任务的动作分布基本不同 - 选择和位置涉及分离的抓取/释放事件,而擦除涉及持续的接触维护.主要基于选择和位置数据训练的基础模型即使视觉理解完美转移,也会在接触丰富的任务上表现得差. 因此,在训练前数据中的任务多样性比数据集规模更重要,
推理成本和延迟比较
零射击与少射击讨论中经常被忽视的一个因素是:生产中运行基础模型的推理成本. 7B参数VLA模型需要专门的GPU来推理 (云上最低A10G,约为0.75美元/小时) 并引入每次行动的100-300ms延迟. 12M参数ACT模型在每次行动的5-15ms上运行在200美元的Jetson Orin Nano上.
对于规模部署 (10+机器人),基础模型的GPU推理成本可能超过每年50,000美元 - - 可能超过收集足够的数据来训练较小的任务特定模型的成本.这是反直觉的经济论点:投资数据收集 (一次性成本) 比支付基础模型的持续推理成本更便宜.
实际的指导
计划200-500次示范,即使是基础模型**.零射击性能是值得测量的奖励,而不是值得假设的基线.如果零射击在任务中取得60%以上的成功,请提前考虑自己.如果达到30%,继续计划的细节调整数据收集.
根据RCSV [数据服务]
相关阅读
- [RL vs模仿学习决策指南]
T2 ) -- 之前的更广泛的培训方法决策 - 机器人数据收集成本分类 -- 您需要进行调整的演示的预算规划
- [LeRobot指南]
T4 ) -- 培训 ACT和传播政策 - [什么使机器人训练数据好?]
T5 ) -- 在数据低的模式中最大化每次示范的价值 - 化身人工智能简单解释 -- 基础模型及其在物理人工智能中的作用
- RCSV平台 --数据集管理和模型培训基础设施
- 收集你需要的20-500个示范,
制定一个合理的数据预算
根据RCSV的规定,您的任务可进行零射击和少射击的可行性评估,并建议适当的示范量.
[与我们的团队谈话]







