Datasets(으)로 돌아가기

2026년 최고의 로봇 학습 데이터셋: 완전한 가이드

2026년 최고의 로봇 학습 데이터 세트 10위: 오픈 X-Embodiment, DROID, BridgeData, LIBERO, CALVIN, ALOHA 등 규모, 라이센스, 사용 사례를 포함합니다.

2026년 로봇 학습 연구에서는 유용한 작업의 90%를 수행하는 놀랍도록 작은 데이터 세트에서 모였습니다. 이 가이드에서는 모방 학습, VLA 훈련 및 벤치마크 보고에 대한 10가지 최고의 오픈 데이터 세트를 순위화합니다. 이 페이지를 시작 지도로 사용하세요. 각 데이터 세트는 다운로드 지침을 가진 깊이있는 다이빙 페이지로 연결됩니다.

빠른 선택

  • ** 훈련 코퍼스:** 오픈 X-체체
  • ** 실세계의 정교한 조율:** DROID
  • ** 저비용 실체 세계:** BridgeData V2
  • VLA eval: LIBERO
  • 장거리 언어: 칼빈
  • ** 통제 된 IL 연구:** RoboMimic
  • ** 양쪽 수동력:** ALOHA

어떻게 순위를 매겼는지

우리는 다섯 가지 요인을 고려했습니다. 규모 (자연 궤도 수와 시간 수), 품질 (센서 일관성, 카메라 리그 안정성, 액션 공간 청결성), 라이선스 (상업 친화성), 생태계 지원 (레로봇, HuggingFace에 대한 사용 가능성, 공식 평가 스크립트, 사전 훈련된 체크포인트) 및 연구 관련성 (로봇 학습 논문 2025-2026에서 인용 수). 모든 다섯 축에서 단일 데이터 세트가 승리하지 않으므로 순위는 오늘날 생산이나 출판 파이프라인에서 실제로 유용한 데이터 세트에 대한 편향입니다.

1. 엑스부체 개방

** 왜 먼저 순위:** OXE는 존재하는 가장 큰 오픈 조작 코퍼스 (22개 실시예에 걸쳐 1M+ 에피소드) 이며 RT-1-X, RT-2-X, OpenVLA, Octo, 그리고 pi0의 사전 훈련 기판입니다. 일반주의 정책을 원한다면, OXE를 시작 전제로 원합니다. 라이센스는 구성 요소마다; 대부분은 CC-BY-4.0 또는 Apache-2.0. [오픈 X-Embodiment 페이지]T0에 깊이 가라, 그리고 [오픈 X vs DROID]T1에 대한 비교를 보아라.

2. DROID

** 왜 두번째로 순위:** DROID는 가장 깨끗한 실제 데이터 세트입니다. 76K 궤도, 564 장, 단일 프랭카 파ண்டா 구현, 일관된 ZED 2 카메라 리그, MIT + CC-BY-4.0.

3. 브리지데이터 V2

왜 3위를 차지하는지는: BridgeData V2는 가장 접근 가능한 실제 데이터 세트입니다 WidowX 250 하드웨어 비용은 3K 이하이며, 데이터 세트의 60K 궤도는 24 개의 자연어 레이블을 가진 환경을 아우르는 것입니다. 그것은 OXE의 핵심 구성 요소이며 저렴한 팔 배포를위한 훌륭한 정교한 목표입니다. CC-BY-4.0 라이선스. [BridgeData V2 페이지]T3) 및 우리의 [BridgeData vs RoboMimic]T4) 비교를 참조하십시오.

4. LIBERO

** 왜 네 번째 순위:** LIBERO는 사실상 VLA 평가 스위트로 변했습니다. 4 개의 작업 스위트, 약 130 개의 작업, 6500 개의 시뮬레이션, Robosuite 시뮬레이션. 2026 년 정책 건축 논문을 발표한다면 LIBERO 번호를 요청받습니다. MIT 라이센스. 우리의 LIBERO 데이터 세트 페이지LIBERO vs CALVIN 비교를 참조하십시오.

5. 칼빈

** 왜 다섯 번째 순위:** CALVIN는 순수한 A/B/C/D 환경 분할을 통해 연쇄된 긴 지평선 언어 명령어를 테스트하는 유일한 표준입니다. 24 시간 동안 텔레오프 데이터. 2026 년에도 여전히 포화되지 않습니다. 이는 실제로 연쇄 작업이 얼마나 어려운지 알려줍니다. MIT 라이선스. [CALVIN 벤치마크 페이지를 참조하십시오]

6 . 로보미믹

** 왜 6위를 차지하는지:** RoboMimic의 PH / MH / MG 시범 품질 분할은 여전히 모방 학습 강도를 연구하는 금 표준입니다. 다섯 가지 Robosuite 작업의 어려움이 증가합니다. 배포 데이터 세트가 아니라 필수적인 진단입니다. MIT 라이선스. RoboMimic 데이터 세트 페이지를 참조하십시오.

7 . ALOHA

** 왜 7위:** ALOHA는 저렴한 두동력 텔레오퍼레이션을 선구했으며 미세한 유능한 조작 연구의 기본 플랫폼으로 남아있다. 공식적인 ALOHA 데이터 세트 및 모바일 ALOHA 확장 프로그램은 두동력 VLA 작업을 계속 추진합니다. Apache / MIT. ALOHA 데이터 세트 페이지 및 우리의 ALOHA 가이드 참조.

8. 로보네트

** 8위:** 7개의 로봇 플랫폼에서 15M 비디오 프레임으로 만들어진 로보네트는 원래의 크로스 인체 데이터 세트입니다. 대부분의 교육 목적으로 OXE가 대체하지만 비디오 전용 학습 및 전송 연구에 여전히 가치가 있습니다. [로보네트 페이지](T11 참조)

9 미미크

** 왜 9위를 차지하는지:** 미믹겐은 데이터 생성 시스템보다 데이터 세트보다 덜: 그것은 ~ 200 개의 인간 씨앗에서 50K+의 시범을 합성합니다. 뭉친 시뮬레이션 작업 스위트는 모방 학습 연구에 유용하며, 미믹겐 파이프라인은 실제 세계 수집을 증강하는 표준이 되고 있습니다. Apache-2.0. [미믹겐 페이지](T12 참조).

10 레로봇 허브

** 왜 10위:** 레로봇은 단일 데이터 세트 아니라 배포 계층이 아닙니다. DROID, ALOHA, BridgeData, Open X 구성 요소, SO-100 등에 대한 통일된 PyTorch 인터페이스입니다. 실제 2026 작업 흐름에 대해 레로봇은 위의 모든 데이터 세트를 소비하는 가장 쉬운 방법입니다. Apache-2.0. 우리의 [레로봇 데이터 세트 페이지를 참조하십시오]

요약 테이블

Rank Dataset Domain Scale Best for License
1 Open X-Embodiment Real (mixed) 1M+ episodes Pretraining Per-component
2 DROID Real (Franka) ~76K trajs Real fine-tune MIT / CC-BY
3 BridgeData V2 Real (WidowX) ~60K trajs Low-cost real CC-BY-4.0
4 LIBERO Sim (Robosuite) ~130 tasks VLA eval MIT
5 CALVIN Sim (PyBullet) 24 hrs teleop Long-horizon MIT
6 RoboMimic Sim 5 tasks, PH/MH/MG IL study MIT
7 ALOHA Real (bimanual) Task-specific Dexterous MIT / Apache
8 RoboNet Real (mixed) 15M frames Video / transfer MIT
9 MimicGen Sim 50K+ synth Data augmentation Apache-2.0
10 LeRobot Hub Distribution Hundreds of datasets Tooling Apache-2.0

현대적인 훈련 레시피

2026년, 디플로이블 조작 정책을 구축하는 모달 레시피는 세 단계입니다. 첫 번째 단계: 사전 훈련 (또는 미리 훈련된 체크포인트에서 시작) 오픈 X-Embodiment. 두 번째 단계: DROID 또는 BridgeData에 중열하여 실제 세계 액션 배포를 앵커합니다. 세 번째 단계: 목표 하드웨어에서 수집된 작업 특정 텔레오퍼레이션 데이터에 미세 조정. 각 단계마다 일반화 오류를 줄이고 정책을 더욱 전문화합니다. 어떤 단계도 건너뛰는 것은 가능하지만 거의 항상 더 나쁘습니다.

벤치마크는 이 레시피에 _diagnostics_로 적합합니다. LIBERO와 CALVIN는 세 번째 단계에 대한 수집 비용을 지출하기 전에 1단계 + 2단계 정책이 일반화하는지 여부를 알려줍니다. RoboMimic PH/MH/MG는 귀하의 정책이 유연성을 입증하는 데 견고하는지 여부를 알려줍니다. 이 벤치마크 중 어느 것도 생산 프록시입니다.

2024년과 2026년 사이에 어떤 변화가 있었을까요?

3가지가 데이터셋의 풍경을 재구조했습니다. 첫째, 오픈 X-Embodiment은 RT-X 및 OpenVLA 체크포인트가 공개되면 "관리있는 실험"에서 "불방울한 사전 훈련"으로 바뀌었습니다. 2024년에 OXE를 사용하지 않은 팀은 거의 모두 2025년에 사용하기 시작했습니다. 둘째, DROID는 데이터 세트 출시에서 표준으로 성숙해 ZED-2-on-Franka 리그가 여러 연구실에서 새로운 실제 데이터 수집의 실제 템플릿이되었습니다. 셋째, 레로봇 생태계는 맞춤형 엔지니어링 프로젝트에서 데이터 세트 소비를 파이토르크 친화적인 상품으로 바꾸어 놓았고, 이는 여러 데이터 세트에서 동시에 훈련하는 장벽을 의미있게 낮추었습니다.

지지를 잃은 데이터 세트는 오래된 단일 작업 시뮬레이션 벤치마크 (Meta-World, FrankaKitchen) 이었다. 그들은 여전히 인용되지만 우리가 관심있는 논문에서 주요 평가 목표로 표시되지 않습니다. 로보넷은 training corpus로서 마찬가지로 쇠퇴하고 있지만 여전히 비디오 기반 방법에는 중요합니다. 실제 세계 면에서는 ALOHA가 자리를 잡았는데, 이는 양동력 자료가 희소하고 가치 있는 것으로 남아 있기 때문입니다.

우리가 포함하지 않은 데이터 세트 (그리고 왜)

ARIO, RH20T, AutoRT 데이터, 모바일 ALOHA 확장 프로그램을 고려했습니다. 모두 유망하지만 너무 새롭고 좁거나 단일 연구소의 하드웨어에 너무 연결되어 2026 년 일반 사용에 대한 확실한 권고가 될 수 있습니다. 우리는 또한 언어 테이블 (Google) 및 메타-월드를 고려했습니다. 그들은 잘 알려져 있지만 OXE + DROID 시대에서 소극적인 사용이 감소하고 있습니다. 만약 여러분의 연구 질문들이 이 질문들 중 하나에서 특별히 혜택을 누리면, 사용하세요. 하지만 그 중 어느 것도 우리의 10위 자리를 차지하지 않았습니다.

자신의 추가 데이터를 수집하는 방법

모든 생산 로봇 팀들은 오픈 데이터 세트가 제공할 수 없는 작업 특수한 텔레오퍼레이션 데이터를 필요로 합니다. 이 곳에는 실리콘밸리의 로봇 센터가 적합합니다. 우리의 [데이터 서비스] (T14) 는 샌프란시스코 연구소에서 프랑카, 와이도우X, ALOHA, 오픈아름 플랫폼에서 사용자 지정 데이터 수집 캠페인을 실행합니다. 전형적인 캠페인은 2-6 주 동안 작업당 500-5000개의 고품질 궤도를 생산하며 RLDS 또는 LeRobot 호환형태에서 전달됩니다.

내부에서 수집 기능을 구축하고자 한다면, 우리의 [스토어] (T15) 는 DROID, BridgeData, ALOHA에서 사용되는 동일한 로봇 팔과 원격 조작 기구를 판매합니다. 그리고 우리의 [데이터 플랫폼] (T16) 는 개방형 데이터 세트가 사용하는 동일한 스케마와 궤도를 흡수하고 라벨을 붙이고, 따라서 귀하의 데이터는 훈련에서 OXE와 DROID와 깨끗하게 혼합됩니다.

자주 묻는 질문

2026년에 어떤 로봇 학습 데이터 세트를 시작해야 할까요?

오픈 X-Embodiment (OpenVLA 또는 pi0) 를 통해 미리 훈련된 체크포인트에서 시작하여 DROID에 정렬하십시오. LIBERO 및 CALVIN 번호를 보고하십시오. 실제 데이터 세트를 사용할 수 있다면 DROID는 가장 깨끗합니다.

오픈 엑스 인보디먼트는 상업용으로 사용 가능할까요?

OXE는 각 구성 요소에 대한 라이선스를 가진 구성 요소 데이터 세트의 레지스트리입니다. 대부분의 구성 요소는 CC-BY-4.0 또는 Apache-2.0이지만 몇 개는 연구용입니다. 상업 정책을 전송하기 전에 구성 요소 목록을 감사하십시오.

LIBERO와 CALVIN의 차이점은 무엇입니까?

LIBERO는 Robosuite에서 4개의 개별 작업 스위트를 가진 평생 학습 벤치마크입니다. VLA 평가에서 기본값입니다. CALVIN는 4개의 환경과 5개의 명령 체인으로 이루어진 긴 지평 기준입니다. 구성 테스트의 금 표준입니다. 우리의 [실밀한 비교]를 참조하십시오.

얼마나 많은 계산이 필요할까요?

오픈VLA 규모의 완전한 OXE 사전 훈련은 약 64 A100를 2주 동안 사용했습니다. DROID 또는 BridgeData에서 미리 훈련된 체크포인트의 정렬은 1~2일 동안 한 8xA100 노드에 실행됩니다. LIBERO 또는 CALVIN 평가는 단일 소비자 GPU에서 실행됩니다.

제 로봇 데이터 세트를 수집할 수 있나요?

예. 오픈 데이터 세트는 훈련 전용으로 가장 좋습니다. 배포를 위해 목표 하드웨어에 대한 작업 특정 데이터가 필요합니다. 우리의 [자 맞춤 데이터 서비스]

관련 자원

  • [LIBERO vs. CALVIN 비교]
  • [X-Embody vs DROID]
  • [브리지데이터와 로보미믹]
  • [모든 데이터 집합 카탈로그]
  • [VLA 및 정책 모델]
  • [표준의 중심]
  • [연구 보고]
  • [로봇스 아카데미]
  • [소프트 로봇 하드웨어]