LIBERO vs. CALVIN: 로봇 학습 벤치마크 비교 2026
2026 년 LIBERO 와 CALVIN: 작업 집합, 데모, 언어 조건화, 실시예 및 라이선스 비교. 평생 또는 장기 로봇 학습에 대한 올바른 기준을 선택하십시오.
LIBERO와 CALVIN는 현대 로봇 학습에서 가장 많이 인용되는 시뮬레이션 기준 중 두 가지입니다. 둘 다 언어 조건적 조작을 목표로하지만 매우 다른 연구 목표를 위해 설계되었습니다. 평생 학습 및 비공개 작업 스위트에서 VLA 평가, 공유 테이블 환경에서 기술의 긴 지평망을 위한 CALVIN. 만약 여러분이 2026년에 보고할 수 있는 숫자를 선택하고 있다면, 이 가이드에서는 규모, 구조, 언어, 실시예, 계산, 라이선스 등에 대한 직접적인 비교를 제공합니다.
TL;DR
- ** 평생 / 지속적인 학습:** LIBERO는 기본입니다
그것은 네 개의 작업 부위에서 지식 전송 평가에 명시적으로 구축되었습니다. - 장수 언어 연쇄: CALVIN는
독보적인 판매점으로 한 배포에서 최대 5개의 언어 명령어의 순서를 평가합니다. - VLA 모델 벤치마킹: LIBERO는 최근 논문 (OpenVLA, [pi0, Octo](
T2 )) 에서 보다 흔하다. - ** 환경 분할 일반화:** CALVIN는 4개의 시각적으로 구별되는 환경 (A, B, C, D) 을 수상하여 깨끗한 기차/테스트 프로토콜을 얻을 수 있습니다.
- ** 지역적으로 작동하기 쉬운:** LIBERO는 가벼워
Robosuite + MuJoCo, T0 . CALVIN는 PyBullet 기반 시뮬레이터를 배포합니다.
한눈에
| Attribute | LIBERO | CALVIN |
|---|---|---|
| First release | 2023 (NeurIPS D&B track) | 2022 (RA-L) |
| Primary goal | Lifelong learning + imitation / VLA eval | Long-horizon language-conditioned manipulation |
| Task suites | 4 suites: Spatial, Object, Goal, LIBERO-100 (Long) | 34 skill classes, chained into sequences of 5 |
| Total tasks | ~130 tasks | One shared environment with compositional task chains |
| 시연 scale | Around 6500 human teleoperation demos (50 per task) | ~24 hours of teleoperation across 4 environments |
| Simulator | Robosuite / MuJoCo | PyBullet (custom tabletop) |
| Embodiment | Franka Emika Panda (7-DoF) | Franka Emika Panda (7-DoF) with parallel gripper |
| Environment splits | Per-suite train/test with held-out configurations | Environments A, B, C, D for zero-shot transfer |
| Language labels | Yes, per task | Yes, crowdsourced natural language instructions |
| Evaluation metric | Success rate per suite + forward / backward transfer | Avg. sequence length successfully completed (out of 5) |
| License | MIT | MIT |
| Paper | arXiv:2306.03310 | arXiv:2112.03227 |
LIBERO가 실제로 테스트하는 것은
LIBERO ("Lifelong Learning Benchmark for robot manipulation") 는 오스틴 대학교와 협력자들이 모방 학습 문헌의 격차에 대한 대응으로 구축되었습니다. 대부분의 이전 벤치마크는 고정된 작업 분포에 대한 정책 품질을 측정했지만, 새로운 작업이 도착함에 따라 로봇이 지식을 축적하고 전송하는 방법을 측정하는 것은 거의 없었습니다. 벤치마어는 4개의 작업 부위로 구성되어 있으며, 각각의 작업은 10개의 작업과 50개의 텔레오퍼레이션 시범이 있으며, 총 130개의 작업과 6,500개의 궤도를 포함하고 있습니다.
네 개의 스위트는 LIBERO-Spatial ( 동일한 객체, 다른 공간 관계), LIBERO-Object ( 같은 레이아웃의 다른 객체 인스턴스), LIBERO-Goal (공유 객체와 다른 목표 지침) 및 **LIBERO-100 (장) **, 현실적인 부엌과 거실 장면에서 추출된 100 개의 긴 지평선 작업의 훨씬 더 어려운 집합입니다. 첫 번째 세 가지는 분배 시퀀스의 단일 축을 분리하도록 설계되어 있습니다. LIBERO-100는 모든 것을 혼합합니다.
현대 VLA 평가에 LIBERO를 매력적으로 만드는 것은 개별 작업 구조가 순위표 스타일의 보고서에 깔끔하게 지도를 내놓는 것입니다. [OpenVLA, Octo, pi0, 및 유사한 기초 정책]
칼빈이 실제로 무엇을 테스트하는지
칼빈 ("Composing Actions from Language and Vision") 는 2022년 프라이부르크 대학교에서 발표되었으며 다른 질문에 대답합니다. 수백 개의 개별 작업 파일 대신, 칼빈은 드래스, 슬라이딩 문, 색색 블록, LED 및 버튼으로 단일 공유 테이블테스톱 환경을 배포합니다. 약 34개의 기본 기술 유형은 정책이 뒤에서 실행해야하는 다섯 가지 명령의 체인으로 구성될 수 있습니다.
데이터 세트는 시각적으로 구별되는 네 가지 환경 (A, B, C, D) 에 분포된 인간 텔레오퍼레이션의 약 24 시간이다. 표준 평가 프로토콜은 환경 중 하나 (또는 하위 집합) 에 열차하고 다른 환경에서 평가하여 자연적인 제로샷 또는 몇 번의 샷 일반화 메트릭을 생성합니다. 칼빈 보고서의 헤드라인 번호는 5개 중 성공적으로 완료된 명령어의 평균 수입니다. 이는 2026년에 아직 포화되지 않은 거침없는 난이도를 만들어냅니다.
칼빈은 또한 단 한 기술 정확성에 비해 장기적 성능이 얼마나 떨어지는지를 알 수 있는 몇 안 되는 기준 중 하나입니다. 개별 기술에 대한 95%의 정확성을 얻는 정책은 종종 두 개의 묶인 명령으로 떨어집니다. 이는 기억, 계획 또는 목표 조건 목표를 테스트 할 때 원하는 신호의 종류입니다.
거래소: 언제 어떤 상품을 선택해야 하는지
Libero를 선택하세요 만약 여러분이 Robosuite에 연결되는 빠르고 낮은 구동 기준을 원한다면, 평생 또는 지속적인 학습에 관심이 있다면, 여러분의 숫자가 OpenVLA/Octo/pi0 순위표와 직접 비교될 수 있고, 또는 압축을 위해 순수한 단위 분할이 필요하다면. LIBERO는 또한 [RL 환경]
CALVIN를 선택하세요 만약 여러분이 긴 지평선 구성적 추론을 필요로 하고, 기술 수준과 연계 수준 성능 사이의 격차에 대해 관심이 있거나, 공유된 환경에서 목표 이미지 또는 언어만 조건화하는 것을 테스트하고 싶다면.
2026년 VLA 논문을 발표할 때 두 가지를 모두 선택하세요. LIBERO 숫자를 보고하는 것은 거의 필수적인 요건이 되었습니다. 그리고 칼빈 순서들은 리베로가 하지 않는 긴 지평선 신호를 리뷰어들에게 제공합니다.
컴퓨터 및 하드웨어
두 벤치마크 모두 단일 소비자 GPU에서 실행됩니다. LIBERO는 MuJoCo 때문에 물리 단계에 CPU에 묶여 있으며 많은 병렬 환경을 실행할 때 8+ 코어 CPU에서 혜택을 누립니다. CALVIN는 PyBullet에서 실행되며, 이는 평행적 인 것이 덜하지만 이미지 공간 탐사선으로 디버깅이 더 쉽습니다. 어느 벤치마크도 데이터 센터 GPU
훈련에 대한 그림은 다릅니다. LIBERO 또는 CALVIN 데모에 대한 전체 규모의 VLA 훈련은 여전히 4-8 GPU가 필요합니다. 시밍이 무거운 것이 아니라 시각 언어의 척추가 있기 때문입니다. 당신이 자신의 훈련된 정책을 가져오고 평가하는 경우에, 단일 작업 스테이션이 작동합니다. 정책 아키텍처에 반복하고 싶다면, 여러 GPU 호스트를 계획하십시오. 우리의 [데이터 플랫폼]
데이터 수집 작업 흐름
두 데이터 세트는 VR가 아닌 키보드/게임패드 텔레오퍼레이션을 통해 수집되었다. 이것은 역사적으로 중요한 것은 디모를 소음이 낮고 매우 반복 가능하도록 유지하기 때문이지만, 또한 [브리지데이터 또는 로보미믹]와 같은 VR가 수집한 데이터 세트보다 움직임 분포가 좁아지기도 한다. LIBERO나 CALVIN에 훈련하고 실제 하드웨어에 배치하는 팀은 종종 더 다양한 텔레오프 데이터로 증강되어야합니다.
라이센스 실체 확인
두 프로젝트는 MIT 라이선스, 학술적 데이터가 얻는 만큼 허용적입니다. 당신은 데이터 세트 둘 다에 대한 상업적 정책을 훈련 할 수 있습니다, 파생 체크포인트를 재배포하고 제품에 삽입 할 수 있습니다. 그렇다고 Robosuite와 CALVIN와 결합된 assets (망 파일, 텍스처 지도) 는 자체 라이선스; 당신이 재산을 추출하고 다시 호스팅하면, 상류 속성을 다시 확인합니다. 실제 팀들은 궤도 데이터를 MIT와 시뮬레이터를 Robosuite 또는 PyBullet의 상류 라이선스로 취급합니다.
2026년 생태계 및 도구
LIBERO는 더 큰 랩퍼 생태계를 가지고 있습니다. 레로봇이 지원하고, HuggingFace는 여러 개의 사전 처리 버전이 있으며, 대부분의 VLA 리포스는 LIBERO eval 스크립트를 배포합니다. CALVIN는 더 깊은 층에 위치합니다.
2026년 논문에서 보고된 결과
LIBERO에서, 강력한 2025 시대의 VLA 정책 (OpenVLA, pi0, Octo 변종) 은 일반적으로 공간, 객체 및 목표에서 70-90%의 성공 범위에서, 훈련 레시피에 따라 LIBERO-100에서 30-60%에 달합니다. 이 스프레드는 흥미롭습니다. 첫 번째 세 개의 스위트에 잘하는 정책은 LIBERO-100에서 절벽에서 떨어지는 경우도 있습니다. 이는 하나의 평균 숫자가 숨기는 일반화 격차를 보여줍니다. 새로운 논문을 읽을 때, 항상 평균보다는 단위별 분해를 확인하십시오. 평균을 보고하는 논문들은 솔직히 무언가를 숨기고 있습니다.
칼빈에서 관찰해야 할 측정값은 Avg. Seq. Len.
레로봇 스택과 통합
두 데이터 세트는 모두 레로봇을 통해 거울 형태로 사용할 수 있습니다. 레로봇은 궤도 스케마를 정상화하고, 파이토르치
판결
한 명만 승리할 수 있는 사람은 없습니다. 만약 당신이 한 명만 실행할 수 있다면, LIBERO
우리 사이트 에 관련 된 자료
- [LIBERO 데이터 세트 세부 사항]
- [칼빈 기준 페이지]
- [열린 X-Embodyment vs DROID 비교]
- [브리지데이터와 로보미믹 비교]
- [2026년 최고의 로봇 학습 데이터 집합]
- [VLA 및 정책 모델 목록]
- [우리의 연구 보고]







