返回Blog

零射击与少射击机器人政策:设定现实的预期

诚实评估2025年零射击和少射击机器人政策的表现 <unk>什么是可实现的,在哪些任务上,

[←博客]

无射机器人是真实的 ,用于简单的任务,在控制条件下,与分布的对象.

定义

零射意味着执行一个新任务或处理一个新的对象,没有新的示范. 机器人完全依赖于预训练期间所学到的东西. 少射意味着适应一个新的任务,有5-50个新的示范.这些功能是有意义的不同的,并将它们结合导致不切实际的规划.

零射击现实

基于机器人操纵的基础模型 OpenVLA,Octo,RT-2 在其培训分布中进行简单任务中证明了真正的零射击能力.

  • 开放词汇物体检测+简单的上下抓计划工作 对于在清晰表面呈现的普通家庭物体中60%的零镜头
  • 在以前探索的环境中使用语言调节的导航在结构设置中成功率达75%
  • 采用熟悉的物体类别 (,瓶,块) 的选择和放置实现了标准基准标准的50-65%的成功零射率

零射击可靠地失败时:需要在5mm以下放置的精密任务,巧妙的操纵,使用新型工具,物体呈现非正规的任务 (倾斜瓶子,堆叠杯子),以及任何涉及训练数据中不充分表示的变形物体的任务.

短拍精细调节:更具实用能力

基本模型最明显的实际价值是在很少的细节调整 (20-100次新任务示范).

Training Approach Demos Required Typical Success Rate Time to Train
Foundation model, zero-shot 0 30–65% (simple tasks) N/A
Foundation model + 20 demo fine-tune 20 70–80% 30 min GPU
Foundation model + 100 demo fine-tune 100 80–90% 2 hr GPU
Train from scratch (ACT) 500 75–88% 3–4 hr GPU
Train from scratch (Diffusion) 1000 82–92% 8–12 hr GPU

基础模型的优势最明显在低数据模式 (低于100个示例).在20个示例中,一个精细调整的基础模型实现了与从头开始训练ACT的成功率相比较的成功率.这就是25倍的数据效率提高,直接转化为节省成本和时间.

现在零射击的实力

  • ** 结构化采集,有明确的对象检测:** DETIC + GraspNet式的开放词汇检测 + 简单的抓住计划器在有组织的垃圾箱中对普通物体进行零射.
  • **已知空间中的语言调节导航:**VLN (视觉语言导航) 模型在被训练理解的空间中工作零射击,并且对不同建筑物的相同布局空间进行了良好的通用化.
  • **按类别识别和排序:**语言条件排序 ("将红色项放在左边的桶里") 对已知类别使用RGB分类工作为零.

没有 (然而)

  • 接触式操纵: 入孔,接头,折叠布料, 零射击成功率为目前的基础模型的10-30%.
  • 新工具使用: 使用一个不熟悉的工具 (一个开器,一个特定的螺丝机) 零射还不可靠.
  • **外部操纵:**手中重新抓取,使用指控的物体旋转所有生产模型的零射电流能力之外.

基金会模型基准结果 (2025-2026)

Model Provider Zero-Shot (SimplerEnv) 20-Shot Fine-Tune Parameters
OpenVLA Stanford/TRI 48-62% 72-80% 7B
Octo Berkeley 35-55% 65-78% 93M
pi-0 Physical Intelligence 55-70% 78-88% 3B
RT-2-X Google DeepMind 50-65% 75-85% 55B
ACT (from scratch) Stanford N/A 40-55% (20 demos) 12M

这些数字代表了在控制实验室环境中简单的操纵基准 (选择位置,抽开放,按) 的性能.由于照明变化,背景混乱和对象多样性在基准条件中不代表,现实世界部署数量通常低于10-20个百分点.

短拍数据效率曲线

根据公布的结果和RCSV内部评估,

  • 5 示范: 基础模型显示了5-15%的改善,比零射击.从零开始的训练产生了不可靠的政策.
  • **20次示范:**基础模型细调的最佳点.大多数模型在此点达到70至80%的最终性能.从零开始,ACT通常达到40至55%.预训练和零的差距为20至30个百分点.
  • **50个示范:**基础模型接近其顶峰 (80-88%). 零碎训练模型缩小了差距,通过收集良好数据达到60-75%.成本差异很大:50个示范成本为200-500美元,RCSV比较为基础模型投资的几个月的预训练计算.
  • **100次示范:**基础模型细调对于大多数任务的回报率降低. 零碎训练模型进一步赶上 (75-85%). 实际问题是,剩余的性能差距是否证明了使用3-7B参数模型进行推断的复杂性.
  • 500次示范: 基于零碎训练的ACT和扩散政策通常与精细调整的基础模型相匹配或超过.在这个数据量下,预训练的优势对于单任务部署是最小的.基础模型保留了多任务通用化的优势.

什么时候使用哪种方法:决策矩阵

Scenario Recommendation Why
Quick feasibility test, simple task Zero-shot with OpenVLA/pi-0 No data cost; instant evaluation
New task, limited budget (<$2K data) Foundation model + 20-50 demo fine-tune Maximum performance per dollar
Production deployment, single task ACT/Diffusion from scratch, 300-500 demos Smaller model = faster inference, simpler deployment
Multi-task deployment (10+ tasks) Foundation model + per-task fine-tuning Shared backbone amortizes model cost
精度 task (sub-2mm tolerance) Scratch Diffusion Policy, 500+ demos Foundation models lack precision for tight tolerances
Edge compute (Jetson, no GPU server) Small model from scratch (ACT 12M params) 7B VLA models cannot run on edge devices

身体的差距:为什么零射击比看起来更难

基于模型规模,NLP的零射击性能可靠地提高:70B语言模型在零射击文本任务上比7B模型一致地更好.同样的扩展关系不适用于机器人基础模型,理解为什么对设置现实的期望至关重要.

基本的挑战是体现差距:与文本不同 (具有普遍的标记化),机器人操作是体现特定的.一个7DOF联合速度命令为Franka Research 3是无意义的6DOF开臂或移动操纵器与不同的动态链. 目前的基础模型通过操作空间正常化 (将所有机器人映射到共享的7DOF表示,这会损失更多或少量的DOF机器人信息) 或实施体现特定输出头 (需要至少对目标实施体现进行几次示范来校准输出头) 来处理这一问题.

这意味着在新的机器人实施例中, "零射击"是功能不可能的 - - 你总是需要至少一个校准步骤.今天运行的零射击能力是零射击在模型训练的相同实施例上新任务.转移到新的实施例总是最小的零射击.

感知差距是第二大挑战.基础模型在特定实验室收集的数据集上训练,使用特定的摄像头,照明和背景.在不同视觉条件的新环境中部署时,视觉编码器的表示变化,降低了政策性能. 这就是为什么发表的零射击数字 (与训练数据相似的实验室收集) 比现实数字高出10-20个百分点.训练期间域名随机定位和视觉语言预训练都有帮助,但今天没有一个完全关闭这一差距.

** 动作分布差距.** 不同任务的动作分布基本不同 - 选择和位置涉及分离的抓取/释放事件,而擦除涉及持续的接触维护.主要基于选择和位置数据训练的基础模型即使视觉理解完美转移,也会在接触丰富的任务上表现得差. 因此,在训练前数据中的任务多样性比数据集规模更重要,

推理成本和延迟比较

零射击与少射击讨论中经常被忽视的一个因素是:生产中运行基础模型的推理成本. 7B参数VLA模型需要专门的GPU来推理 (云上最低A10G,约为0.75美元/小时) 并引入每次行动的100-300ms延迟. 12M参数ACT模型在每次行动的5-15ms上运行在200美元的Jetson Orin Nano上.

对于规模部署 (10+机器人),基础模型的GPU推理成本可能超过每年50,000美元 - - 可能超过收集足够的数据来训练较小的任务特定模型的成本.这是反直觉的经济论点:投资数据收集 (一次性成本) 比支付基础模型的持续推理成本更便宜.

实际的指导

计划200-500次示范,即使是基础模型**.零射击性能是值得测量的奖励,而不是值得假设的基线.如果零射击在任务中取得60%以上的成功,请提前考虑自己.如果达到30%,继续计划的细节调整数据收集.

根据RCSV [数据服务]T1的建议,在您承诺收集时间表之前,您的具体任务可评估零截图可行性,并建议一个现实的示范预算.

相关阅读

  • [RL vs模仿学习决策指南]T2) -- 之前的更广泛的培训方法决策
  • 机器人数据收集成本分类 -- 您需要进行调整的演示的预算规划
  • [LeRobot指南]T4) -- 培训 ACT和传播政策
  • [什么使机器人训练数据好?]T5) -- 在数据低的模式中最大化每次示范的价值
  • 化身人工智能简单解释 -- 基础模型及其在物理人工智能中的作用
  • RCSV平台 --数据集管理和模型培训基础设施
  • 收集你需要的20-500个示范,

制定一个合理的数据预算

根据RCSV的规定,您的任务可进行零射击和少射击的可行性评估,并建议适当的示范量.

[与我们的团队谈话]