返回Benchmarks

卡尔文

语言和视觉的作曲. 长视野,语言条件的操纵基准. 机器人. 风险.

构成语言和视觉的行动 长视线,语言条件的操纵.

概述

卡尔文评估了长远的视野中语言条件的操纵.代理必须从自然语言指令中构建多种技能.基于模拟. 罗博弗莱明戈和其他基于VLM的政策显示出强的性能.

官方链接

  • T1) 代码和数据集

我们的评估循环在物理平台上评分它们.

RCSV Eval → 许可证培训数据 →