返回Datasets

卡尔文:长远的语言调节机器人操纵

探索CALVIN:24小时的电话通信,在4个环境中完成34项任务,使用自然语言标签.

具有全自然语言标签的24小时,四个环境的桌面操作数据集 在机器人政策中遵循的构成指令的标准标准.

Metric Value
Task count 34 distinct subtasks, 5-instruction evaluation chains
Robots Franka Emika Panda (PyBullet simulation)
Modalities RGB static + gripper cameras, depth, proprioception, language
License MIT
Size ~24 hours of teleop play data (~166 GB uncompressed)
Environments A, B, C, D (different textures, lighting, object layouts)

卡尔文是什么?

弗莱堡大学发布了CALVIN (由语言和视觉构成行动) 旨在在长期的时间表来测试语言条件的机器人政策. 它从剪辑式基准中采用不同的数据收集理念:而不是记录每项标记任务的一个示范,Calvin记录了24小时的非指导式远程操作"游戏"在一个Franka Emika Panda上,然后以后向后划分和标记这些轨迹以自然语言. 这产生了密集的模仿学习信号和每技能数百个不同的英语短语的多任务语言体.

基准标准设有四个环境 (A,B,C,D) 具有相同的桌面几何学,但不同于结构,照明和关联物体的布局,一个滑门,一个抽,一个手柄,各种颜色的块和一个LED按.四字母的训练/评估分区 (ABCD→D,ABC→D,D→D) 让研究人员将环境通用化与纯粹的模仿性能隔离.

根据"长视野语言"的声明,Calvin是每次论文中选择的基准指标,因为官方评估协议连续链接了五项指令,并且只有当所有五项子任务都顺序完成时才会将部署视为成功. 这种复合故障模式使得CALVIN数量比单任务基准更难和,

如何下载和加载

# Clone the benchmark
git clone --recursive https://github.com/mees/calvin.git
cd calvin && sh install.sh

# Download the full ABCD split (~166 GB)
cd dataset && sh download_data.sh ABCD

# Iterate demos in Python
from calvin_env.envs.play_table_env import get_env
from calvin_agent.datasets.npz_dataset import NpzDataset
d = NpzDataset(data_dir='dataset/task_ABCD_D/training')
print(d[0]['rgb_static'].shape, d[0]['language']['ann'])

对于规模培训,大多数团队将CALVIN转换为RLDS或LeRobot格式,以便它可以与Open X-Embodiment和BridgeData v2共享数据加载器.

常见使用情况和配对

  • **语言条件政策.**HULC,HULC++,和GR-1都发布了CALVIN号码;这是展示一种新的语言条件政策工作的最短途径.
  • **VLA细调.**RoboFlamingo,RT-2,和OpenVLA变体在CALVIN上进行细调,以验证语言的基础;序列链准确性是VLA指令遵循的好代理.
  • ** 隐藏计划/世界模型.** 长期未标记的游戏数据经常用于在下游任务专业化之前预训练隐藏计划生成器 (LATMO,SkillMimic).
  • **Sim-to-real验证.**四个环境的分离使研究人员能够将纹理和布局转移与实际操纵能力分开.

基准和排名表

报告的指标是成功指导链的平均长度 (0至 5). 查看 CALVIN编码的论文排行榜官方项目网站 查看最新情况.