返回Datasets

利贝罗与卡尔文:机器人学习基准比较2026年

2026年Libero vs.CALVIN:任务套件,演示,语言条件,实施方案和许可证比较.选择适合终身或长期机器人学习的基准.

利贝罗和卡尔文是现代机器人学习中最广泛引用的模拟基准. 它们都针对语言条件的操纵,但它们的研究目标非常不同:LIBERO用于终身学习和VLA评估在单独任务套件上,CALVIN用于在共享桌面环境中的长视角技能链. 如果您正在选择在2026年报告数字的哪个, 这本指南将为您提供规模,结构,语言,体现,计算和许可的直接比较.

  • 终身/持续学习: LIBERO是默认的它被专门用于四个任务组的知识转移评估.
  • **长视野语言链:**Calvin获胜 其独特的销售点是在一个推广中评估最多五种语言指令的序列.
  • VLA模型基准分析: LIBERO在最近的论文中更常见 (OpenVLA, [pi0, Octo](T2)) 因为其单独的套件很容易报告.
  • **环境分类通用化:**CALVIN获奖 四个视觉不同的环境 (A,B,C,D) 给出了清洁的火车/测试协议.
  • 本地操作的便利: LIBERO 较轻 Robosuite + MuJoCo, T0.

一眼看看

Attribute LIBERO CALVIN
First release 2023 (NeurIPS D&B track) 2022 (RA-L)
Primary goal Lifelong learning + imitation / VLA eval Long-horizon language-conditioned manipulation
Task suites 4 suites: Spatial, Object, Goal, LIBERO-100 (Long) 34 skill classes, chained into sequences of 5
Total tasks ~130 tasks One shared environment with compositional task chains
示范 scale Around 6500 human teleoperation demos (50 per task) ~24 hours of teleoperation across 4 environments
Simulator Robosuite / MuJoCo PyBullet (custom tabletop)
Embodiment Franka Emika Panda (7-DoF) Franka Emika Panda (7-DoF) with parallel gripper
Environment splits Per-suite train/test with held-out configurations Environments A, B, C, D for zero-shot transfer
Language labels Yes, per task Yes, crowdsourced natural language instructions
Evaluation metric Success rate per suite + forward / backward transfer Avg. sequence length successfully completed (out of 5)
License MIT MIT
Paper arXiv:2306.03310 arXiv:2112.03227

LIBERO实际测试的内容

在Austin大学和同事们的研究中, LIBERO ("Lifelong learning benchmark for robot manipulation") 是为了应对模仿学习文献的差距而建立的:大多数以前的 benchmarks 测量了固定任务分配的政策质量,但很少有测量了机器人随着新任务的到来,如何积累和传输知识. 基准标准分为四个任务组,每个任务约有10个任务和每任务50个遥控操作示范,共约有130个任务和6,500个轨迹.

四个套房是LIBERO-Spatial (相同的物体,不同的空间关系), LIBERO-Object (相同布局中的不同物体实例), LIBERO-Goal (共享物体的不同目标指令), **LIBERO-100 (长) **,这是一个比较难的100个从现实的厨房和客厅场景中提取的长视界任务. 首先,三个是以隔离单个分布转移轴的设计;LibERO-100混合了一切.

现代VLA评估的利比罗吸引力是因为分离任务结构清晰地映射到排名表式报告中.当[OpenVLA,Octo,pi0,类似的基础政策]T5) 进行评估时,论文通常报告四个数字每套件加上平均值. 这比单个长视野分数更容易消费,

卡尔文实际上测试的内容

卡尔文 ("Composing Actions from Language and Vision") 于2022年由弗莱堡大学发布,回答了一个不同的问题:它所看到的政策链技能可以单独分成自然语言所规定的长序列吗? 卡尔文不仅提供了数百个单独的任务文件,而是提供了一个单独的共享桌面环境,包括抽,滑门,彩色块,LED和按.大约34种基本技能类型可以组建成五个指令链,该政策必须以后后后执行.

数据集约是人类24小时的远程操作,分布在四个视觉不同的环境中 (A,B,C,D).标准评估协议在环境中的一个 (或子集) 上进行训练,并在另一个环境上进行评估,产生自然的零射击或少数射击通用化度. 卡尔文报告的标题号是5项中成功完成的指令的平均数,这创造了2026年仍然没有和的的难度梯度.

卡尔文也是少数几个基准标志之一,你可以看到长视野表现与单个技能准确性相比有多大崩. 95%的个人技能的政策通常会落入两个链条的指令,这正是你在测试记忆,规划或目标条件目标时想要的信号.

交易:何时选择哪个

**选择 LIBERO,如果你想一个快速,低摩擦的基准,将它插入Robosuite,你关心终身或持续学习,你想你的数字与OpenVLA/Octo/pi0排名板直接相比,或者你需要一个清洁的每套分类, T6) 在笔记本电脑上运行, MuJoCo是轻,

选择CALVIN如果你需要长视野的构成推理,你关心技能水平和链级绩效之间的差距,或者你想在共享环境中测试目标图像或仅基于语言的条件.CALVIN也是层次或基于规划的政策的更有趣的基准,因为其链接序列表面失败,每任务的指标隐藏.

报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是:

计算机和硬件

由于MuJoCo,LIBERO是对物理步骤的CPU绑定,并且在推出许多并行环境时从8+核心CPU中获益.CALVIN运行在PyBullet上,这使其不太平行,但更容易通过图像空间探测器进行调试.任何一个基准都不需要数据中心GPU RTX 4090甚至3090足以评估完整套件.

对于训练来说,情况不同.在LibERO或CALVIN演示程序之上,全尺度VLA训练仍然需要4-8个GPU,不是因为模拟器很重,而是因为视觉语言的背骨是如此.如果你带来了自己的训练政策,只做评估,一个工作站就能工作.如果你想重复政策架构,请计划多个GPU主机. 我们的数据平台也可以卸载轨迹存储和评估管弦.

数据收集工作流程

这种数据集都是通过键盘/游戏台的遥控操作收集的,而不是VR.这是具有历史意义的,因为它使得演示节目低噪音和高度可重复,但它也使运动分布比像 [BridgeData或 RoboMimic]T8这样的VR收集的数据集更窄. 训练在 LIBERO 或 CALVIN 上,并部署在现实硬件上,经常需要使用更多的多元化电话数据来增强.

许可证实实验

两项项目均有MIT许可,这与学术数据一样允许.你可以在任何数据集上训练商业政策,重新分配衍生检查点,并将它们嵌入产品中.这就是说,与Robosuite和CALVIN捆绑的 assets (网格文件,纹理地图) 有自己的许可证;如果你提取和重新托管资产,重新检查上游属性. 在实践中,团队将轨迹数据视为MIT,模拟器则视为Robosuite或PyBullet的上游许可.

2026年生态系统和工具

利比罗拥有更大的包装生态系统:LeRobot支持它,HuggingFace有几个预处理版本,大多数VLA备份都运送了LibERO eval脚本.CALVIN坐落在更深层的使用它,你通常克隆官方CALVIN备份并运行他们的 eval.这两种备份都很好维护;如果您想要零集成工作,LibERO是最安全的选择.

报告结果将在2026年报纸中看到

在LibERO上,强大的2025年VLA政策 (OpenVLA,pi0,Octo变体) 通常在空间,物体和目标上达到70-90%,在LibERO-100上达到30-60%,取决于训练配方. 报道的结果很有趣:在前三套件中表现得很好的政策有时会在 LIBERO-100上跌落,这揭示了一个通用化差距,一个平均数字可以隐藏.当你读一篇新论文时,总是检查每套件的分数,而不是平均值.

在Calvin上,要观察的指标是 Avg. Seq. Len. 平均在5个推出中完成的指令数.强大的2025型号在更容易的A到A评估上达到3.5-4.0左右,在零射D评估上下降到2.0-3.0.零射D评估上任何超过4.0的东西都被认为是最先进的2026年初. 因为CALVIN使用成功的产量指标,即使是小的每步回归都会显著复合,这正是使CALVIN成为有用的基准的特点.

与LeRobot堆的集成

两套数据都可通过LeRobot以镜像形式使用.LeRobot将轨迹方案正常化,暴露PyTorch T1接口,并处理碎片视频解码.如果你从零开始训练了扩散政策或变压器政策,LeRobot路径是最快的方法,不需要写定制加载器来消耗LIBERO和CALVIN. 对于评估,您仍然需要运行原始的 LIBERO 或CALVIN eval ,它们包含了排名表所依赖的官方任务配置和成功检查器.

判决

没有一个获胜者.如果你只能运行一个,运行Libero ,它在2026年论文中便宜,更快,更标准,并插入了最广泛的预训练政策.如果你的研究问题具体是关于长视线语言链,CALVIN仍然是独特的,仍然没有和.今天大多数严重的VLA论文都报告了这两者,你也可能应该这样做. 紧密计算预算的团队应该优先考虑 LIBERO;研究规划,内存或等级政策的团队应该优先考虑CALVIN. 认真对运输的团队应该,经过基准,转向现实数据收集.

相关资源在我们的网站

  • [LIBERO数据集详细]
  • [卡尔文基准页面]
  • T13) T13
  • [2026年最好的机器人学习数据集]
  • [VLA和政策模式目录]
  • T17)