利贝罗与卡尔文:机器人学习基准比较2026年
2026年Libero vs.CALVIN:任务套件,演示,语言条件,实施方案和许可证比较.选择适合终身或长期机器人学习的基准.
利贝罗和卡尔文是现代机器人学习中最广泛引用的模拟基准. 它们都针对语言条件的操纵,但它们的研究目标非常不同:LIBERO用于终身学习和VLA评估在单独任务套件上,CALVIN用于在共享桌面环境中的长视角技能链. 如果您正在选择在2026年报告数字的哪个, 这本指南将为您提供规模,结构,语言,体现,计算和许可的直接比较.
利
- 终身/持续学习: LIBERO是默认的
它被专门用于四个任务组的知识转移评估. - **长视野语言链:**Calvin获胜
其独特的销售点是在一个推广中评估最多五种语言指令的序列. - VLA模型基准分析: LIBERO在最近的论文中更常见 (OpenVLA, [pi0, Octo](
T2 )) 因为其单独的套件很容易报告. - **环境分类通用化:**CALVIN获奖
四个视觉不同的环境 (A,B,C,D) 给出了清洁的火车/测试协议. - 本地操作的便利: LIBERO 较轻
Robosuite + MuJoCo, T0 .
一眼看看
| Attribute | LIBERO | CALVIN |
|---|---|---|
| First release | 2023 (NeurIPS D&B track) | 2022 (RA-L) |
| Primary goal | Lifelong learning + imitation / VLA eval | Long-horizon language-conditioned manipulation |
| Task suites | 4 suites: Spatial, Object, Goal, LIBERO-100 (Long) | 34 skill classes, chained into sequences of 5 |
| Total tasks | ~130 tasks | One shared environment with compositional task chains |
| 示范 scale | Around 6500 human teleoperation demos (50 per task) | ~24 hours of teleoperation across 4 environments |
| Simulator | Robosuite / MuJoCo | PyBullet (custom tabletop) |
| Embodiment | Franka Emika Panda (7-DoF) | Franka Emika Panda (7-DoF) with parallel gripper |
| Environment splits | Per-suite train/test with held-out configurations | Environments A, B, C, D for zero-shot transfer |
| Language labels | Yes, per task | Yes, crowdsourced natural language instructions |
| Evaluation metric | Success rate per suite + forward / backward transfer | Avg. sequence length successfully completed (out of 5) |
| License | MIT | MIT |
| Paper | arXiv:2306.03310 | arXiv:2112.03227 |
LIBERO实际测试的内容
在Austin大学和同事们的研究中, LIBERO ("Lifelong learning benchmark for robot manipulation") 是为了应对模仿学习文献的差距而建立的:大多数以前的 benchmarks 测量了固定任务分配的政策质量,但很少有测量了机器人随着新任务的到来,如何积累和传输知识. 基准标准分为四个任务组,每个任务约有10个任务和每任务50个遥控操作示范,共约有130个任务和6,500个轨迹.
四个套房是LIBERO-Spatial (相同的物体,不同的空间关系), LIBERO-Object (相同布局中的不同物体实例), LIBERO-Goal (共享物体的不同目标指令), **LIBERO-100 (长) **,这是一个比较难的100个从现实的厨房和客厅场景中提取的长视界任务. 首先,三个是以隔离单个分布转移轴的设计;LibERO-100混合了一切.
现代VLA评估的利比罗吸引力是因为分离任务结构清晰地映射到排名表式报告中.当[OpenVLA,Octo,pi0,类似的基础政策]
卡尔文实际上测试的内容
卡尔文 ("Composing Actions from Language and Vision") 于2022年由弗莱堡大学发布,回答了一个不同的问题:它所看到的政策链技能可以单独分成自然语言所规定的长序列吗? 卡尔文不仅提供了数百个单独的任务文件,而是提供了一个单独的共享桌面环境,包括抽
数据集约是人类24小时的远程操作,分布在四个视觉不同的环境中 (A,B,C,D).标准评估协议在环境中的一个 (或子集) 上进行训练,并在另一个环境上进行评估,产生自然的零射击或少数射击通用化度. 卡尔文报告的标题号是5项中成功完成的指令的平均数,这创造了2026年仍然没有
卡尔文也是少数几个基准标志之一,你可以看到长视野表现与单个技能准确性相比有多大崩
交易:何时选择哪个
**选择 LIBERO,如果你想一个快速,低摩擦的基准,将它插入Robosuite,你关心终身或持续学习,你想你的数字与OpenVLA/Octo/pi0排名板直接相比,或者你需要一个清洁的每套分类,
选择CALVIN如果你需要长视野的构成推理,你关心技能水平和链级绩效之间的差距,或者你想在共享环境中测试目标图像或仅基于语言的条件.CALVIN也是层次或基于规划的政策的更有趣的基准,因为其链接序列表面失败,每任务的指标隐藏.
报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是: 报价的值观是:
计算机和硬件
由于MuJoCo,LIBERO是对物理步骤的CPU绑定,并且在推出许多并行环境时从8+核心CPU中获益.CALVIN运行在PyBullet上,这使其不太平行,但更容易通过图像空间探测器进行调试.任何一个基准都不需要数据中心GPU
对于训练来说,情况不同.在LibERO或CALVIN演示程序之上,全尺度VLA训练仍然需要4-8个GPU,不是因为模拟器很重,而是因为视觉语言的背骨是如此.如果你带来了自己的训练政策,只做评估,一个工作站就能工作.如果你想重复政策架构,请计划多个GPU主机. 我们的数据平台也可以卸载轨迹存储和评估管弦.
数据收集工作流程
这种数据集都是通过键盘/游戏台的遥控操作收集的,而不是VR.这是具有历史意义的,因为它使得演示节目低噪音和高度可重复,但它也使运动分布比像 [BridgeData或 RoboMimic]
许可证实实验
两项项目均有MIT许可,这与学术数据一样允许.你可以在任何数据集上训练商业政策,重新分配衍生检查点,并将它们嵌入产品中.这就是说,与Robosuite和CALVIN捆绑的 assets (网格文件,纹理地图) 有自己的许可证;如果你提取和重新托管资产,重新检查上游属性. 在实践中,团队将轨迹数据视为MIT,模拟器则视为Robosuite或PyBullet的上游许可.
2026年生态系统和工具
利比罗拥有更大的包装生态系统:LeRobot支持它,HuggingFace有几个预处理版本,大多数VLA备份都运送了LibERO eval脚本.CALVIN坐落在更深层的
报告结果将在2026年报纸中看到
在LibERO上,强大的2025年VLA政策 (OpenVLA,pi0,Octo变体) 通常在空间,物体和目标上达到70-90%,在LibERO-100上达到30-60%,取决于训练配方. 报道的结果很有趣:在前三套件中表现得很好的政策有时会在 LIBERO-100上跌落,这揭示了一个通用化差距,一个平均数字可以隐藏.当你读一篇新论文时,总是检查每套件的分数,而不是平均值.
在Calvin上,要观察的指标是 Avg. Seq. Len.
与LeRobot堆的集成
两套数据都可通过LeRobot以镜像形式使用.LeRobot将轨迹方案正常化,暴露PyTorch
判决
没有一个获胜者.如果你只能运行一个,运行Libero
相关资源在我们的网站
- [LIBERO数据集详细]
- [卡尔文基准页面]
T13 ) T13 - [2026年最好的机器人学习数据集]
- [VLA和政策模式目录]
T17 )







