Datasets(으)로 돌아가기

칼빈: 장수 언어 조건으로 로봇 조작

칼빈을 탐험하세요. 자연어 레이블을 가진 4개의 환경에서 34개의 작업에서 24시간의 텔레오프. 15분 안에 HULC를 다운로드하고 정렬하고 벤치마크를 합니다.

24시간, 4 환경 테이블톱 조작 데이터 세트, 전체 자연어 표기 로봇 정책에 따라 구성 지침의 가공적 기준.

TL;DR

Metric Value
Task count 34 distinct subtasks, 5-instruction evaluation chains
Robots Franka Emika Panda (PyBullet simulation)
Modalities RGB static + gripper cameras, depth, proprioception, language
License MIT
Size ~24 hours of teleop play data (~166 GB uncompressed)
Environments A, B, C, D (different textures, lighting, object layouts)

칼빈은 뭐죠?

칼빈 (언어와 시각에서 작곡하는 행동) 은 프라이부르크 대학에서 긴 시간 지평선에서 언어 조건으로 구성된 로봇 정책을 스트레스 테스트하기 위해 발표되었습니다. 클립 스타일 벤치마크에서 다른 데이터 수집 철학을 취합니다. 라벨된 작업에 대한 하나의 시범을 녹음하기보다는 칼빈은 프랭카 에미카 파다에 ~24시간의 무관리된 텔레오퍼레이션 "플레이"를 녹음하고 그 후 후반적으로 세분화하고 자연어로 그 궤도를 대중 라벨로 표시했습니다. 이것은 밀집한 모방 학습 신호와 각 기술에 따라 수백 개의 다른 영어 문구를 포함하는 다중 작업 언어 코퍼스를 모두 생성합니다.

벤치마크는 같은 테이블탑 기하학을 공유하지만 텍스처, 조명 및 관절 물체의 조립에 차이가 있는 네 개의 환경을 (A, B, C, D) 씩 배열합니다. 슬라이딩 문, 드래제, 핸들, 다양한 색상의 블록 및 LED 버튼. 네 글자 훈련/평가 분할 (ABCD→D, ABC→D, D→D) 은 연구자들이 환경 일반화를 순수한 모방 성능에서 분리할 수 있게 해줍니다.

칼빈은 종이 "장수 지평의 언어"를 주장할 때 선택의 기준이 됩니다. 공식 평가 프로토콜은 5개의 연속적인 지침을 묶고 있으며 모든 다섯 개의 하위 작업이 순서대로 완료되면만 임무를 성공적으로 수행한다고 간주합니다. 이 복합 실패 모드는 CALVIN 숫자를 단일 작업 기준보다 더 더 쉽게 포화시킬 수 있습니다. 그래서 HULC, RT-2, GR-1, 그리고 RoboFlamingo 모두 그것에 대해 보고합니다.

다운로드 및 로딩 방법

# Clone the benchmark
git clone --recursive https://github.com/mees/calvin.git
cd calvin && sh install.sh

# Download the full ABCD split (~166 GB)
cd dataset && sh download_data.sh ABCD

# Iterate demos in Python
from calvin_env.envs.play_table_env import get_env
from calvin_agent.datasets.npz_dataset import NpzDataset
d = NpzDataset(data_dir='dataset/task_ABCD_D/training')
print(d[0]['rgb_static'].shape, d[0]['language']['ann'])

대규모 훈련에 있어서 대부분의 팀은 CALVIN를 RLDS 또는 LeRobot 형식으로 변환하여 Open X-Embodiment 및 BridgeData v2와 데이터 로더를 공유할 수 있습니다. 변환 스크립트는 T1 디렉토리에서 유지됩니다.

일반적인 사용 사례 및 결합

  • 언어 조건 정책. HULC, HULC++, 그리고 GR-1 모두 CALVIN 번호를 발표하고, 새로운 언어 조건 정책 작업을 보여주는 가장 짧은 길이다.
  • VLA 정교화. RoboFlamingo, RT-2, 그리고 OpenVLA 변종은 CALVIN에 정교화하여 언어 지형화를 검증합니다. 순서 연쇄 정확도는 VLA 명령어를 따르는 데 좋은 대리입니다.
  • ** 래텐트 계획 / 세계 모델.** 긴 라벨이 없는 플레이 데이터는 하류 작업 전문화 전에 래텐트 계획 생성자 (LATMO, SkillMimic) 를 미리 훈련시키는 데 자주 사용됩니다.
  • 시미-실적 검증. 네 환경 분할은 연구자들이 실제 조작 능력에서 텍스처와 레이아웃 변경을 분리할 수 있게 해준다.

벤치마크 & 랭킹보드

보고된 매트릭은 성공적인 명령 체인 (0~5) 의 평균 길이를 나타냅니다. 최신의 최신 기술에 대해 CALVIN 코드 있는 문서공식 프로젝트 사이트 를 참조하십시오.