오픈 엑스체체와 드로이드: 어떤 로봇 데이터 세트를 사용해야 하는가?
오픈 X-Embodiment vs DROID: 궤도 규모, 실시예, 데이터 형식, 라이선스, 훈련 계산 비교. 2026년에 올바른 기초 모델 로봇 데이터 세트를 선택하십시오.
오픈 X-Embodiment과 DROID는 2026년 가장 큰 오픈 로봇 학습 데이터 세트입니다. 그들은 디자인 스펙트럼의 반대 끝에 위치하고 있습니다. 오픈 X-Embodiment은 22개의 다른 로봇 유형에 걸쳐 33개의 연구 실험실에서 구성된 연방 메가 코러푸스이며, DROID는 수백 개의 실제 장면에서 프랭카 파다에서 수집된 단일 인체, 단일 프로토콜 데이터 세트입니다. 어느 쪽을 사용해야 하는지는 스케일-프레인링이나 컨시스턴스-프레인링에 대해 관심이 있는지에 달려 있습니다.
TL;DR
- **
궤도 수:** 오픈 X-Embodiment은 1M+ 에피소드를 DROID의 ~76K에 승리합니다. - 체육 다양성: 오픈 X-체육은
22 개의 로봇 유형과 DROID의 단일 프랭카 파ண்டா를 승리합니다. - ** 경로별 장면 다양성:** DROID는 13개의 기관에서 564개의 장면을 연속 센서로 수상한다.
- ** 데이터 일관성:** DROID는 큰 차이로 승리합니다
동일한 하드웨어, 동일한 카메라 기기, 동일한 에피소드 형식. - 정책 훈련의 용이성: DROID는 승리합니다
교차 인체화 작업 정상화가 필요하지 않습니다. - 기본 모델을 훈련하는 편리함: 오픈 X-Embodiment
RT-X가 구축된 것이 바로 이 것입니다.
머리 대 머리 비교 테이블
| Attribute | Open X-Embodiment | DROID |
|---|---|---|
| Released | Oct 2023 (Google DeepMind + 33 partners) | Mar 2024 (Stanford / UC Berkeley / TRI + 13 partners) |
| Trajectories | 1,000,000+ episodes | ~76,000 trajectories (~350 hours) |
| Embodiments | 22 robot types (Franka, Google Robot, xArm, WidowX, UR5, etc.) | 1 (Franka Emika Panda with parallel-jaw gripper) |
| Scenes / environments | Mix of labs and uncontrolled environments | 564 scenes across 13 institutions |
| Collection duration | Aggregate of many prior datasets (years) | ~18 months of coordinated collection |
| Cameras | Varies by source dataset | 2x ZED 2 stereo + 1x ZED Mini wrist (consistent) |
| Format | Unified RLDS (TensorFlow Datasets) | RLDS + HDF5; also on HuggingFace / LeRobot |
| Approx. size on disk | Multiple TB (varies by component) | ~1.7 TB raw |
| License | Per-component (mostly CC-BY and Apache-2.0) | MIT + CC-BY-4.0 |
| Reference models | RT-1-X, RT-2-X, OpenVLA, Octo | DROID diffusion policies; used by pi0, OpenVLA fine-tunes |
| Paper | arXiv:2310.08864 | arXiv:2403.12945 |
디자인 철학의 격차
오픈 X-Embodiment (OXE) 는 확장 실험으로 설계되었다: 우리가 모든 개방형 조작 데이터 세트를 하나의 표준화된 형식으로 통합한다면, 22 개의 다른 로봇을 통해 전송되는 단일 정책을 훈련시킬 수 있습니까? RT-1-X 및 RT-2-X에서 입증 된 대답은 신중한 예였습니다. 따라서 OXE는 _pretraining corpus_로 이해됩니다. 궤도는 품질, 카메라 리그, 조명, 액션 주파수 및 지갑 컨벤션에 따라 매우 다양합니다. 그것들을 소비하는 것은 공유 RLDS 스키마를 통해 신중한 정상화를 필요로합니다.
DROID는 이차적 데이터를 집합하는 대신 하나의 하드웨어 기구를 표준화 (프랑카 판다, 장면을 위한 ZED 2 카메라, 손목에 탑재된 ZED 미니) 하여 13개의 연구 기관에 배포하였다. 약 18개월 동안, 이들 연구소는 사무실, 부엌, 연구소, 통로, 가정에서 약 76,000개의 야생 궤도를 수집하였다. 모든 궤도는 동일한 관찰 형태, 동일한 행동 컨벤션, 동일한 언어 해설 형식을 가지고 있습니다. 이것은 DROID를 OXE보다 훨씬 쉽게 훈련시키고 더 깨끗한 미세한 음으로 보람을 줍니다.
언제 훈련해야 하는
OXE에서 훈련하는 경우 일반주의적 크로스 인체화 정책을 구축하고 있습니다. RT-X 및 OpenVLA 는 OXE 규모의 사전 훈련이 단일 인체화 데이터 세트가 할 수 없는 행동을 풀 수 있다는 존재 증거입니다. 어쨌든 자신의 실시예에 미세 조정할 계획이라면, OXE는 가능한 최대 사전을 제공합니다.
** DROID에 대한 정렬** 목표 하드웨어는 Franka Panda 또는 거의 동등한 7-DoF 팔이거나, 또는 퍼포션 정책을 훈련하고 있으며, 일관된 지잡기 의미와 함께 고품질의 액션 레이블을 원하는 경우. DROID는 야생 일반화에 관심이 있다면 더 좋은 선택입니다.
**** 계산을 할 수 있다면 둘 다하십시오. 이제 표준 레시피는 "OXE 프리트레인, DROID 미세조정, 작업 디모 미세조정-2". 이것은 pi0 및 2025 몇 가지 인본 정책 이 사용했으며, 2026 년에 표준을 설정하는 것이 계속됩니다.
훈련에 필요한 계산
OXE 사전 훈련은 OpenVLA 규모 (7B 매개 변수) 에서 원래 약 2주 동안 64 A100 GPU를 사용했습니다. 이는 공개 클라우드에서 실제 자본 비용 $ 100,000 정도입니다. 사전 훈련된 체크포인트만 정렬하려면 1일 또는 2일 동안 단일 8xA100 또는 8xH100 노드가 전형적입니다. DROID 미세조는 1-4 GPU에서 수행될 수 있는데, 데이터 세트가 훨씬 작기 때문에 많은 팀은 하나의 8x3090 작업 스테이션에서 전체 DROID 전파 정책을 훈련합니다.
결론적으로, 두 데이터 세트 모두 소비자 GPU에서 편안하게 실행되는 정책을 생성합니다. 특정 연구 이유가 없으면 두 데이터 세트에서 처음부터 훈련을 권장하지 않습니다. HuggingFace의 사전 훈련된 체크포인트는 매우 강력한 출발점입니다.
면허: 작게 된 글씨를 읽어보세요
OXE는 단일 라이선스 아닙니다. 그것은 각각의 고유한 용어를 가진 구성 요소 데이터 세트의 레지스트리입니다. 대부분의 구성 요소는 CC-BY-4.0 또는 Apache-2.0입니다. 즉, 당신은 상용 모델을 훈련하고 파생 중량을 배포할 수 있습니다. 몇 가지 구성 요소는 연구용입니다. 당신이 제품을 만들고 있다면, 당신의 법적 자세에 따라 구성 요소 목록을 감사하십시오. DROID는 데이터에 있어서 간단합니다. MIT+CC-BY-4.0입니다. 상업적 사용에 허용되며, 배정도 있습니다.
데이터 형식 및 도구
두 데이터 세트는 모두 RLDS를 가공적인 형식으로 사용하고 있으며, 둘 다 레로봇 생태계를 통해 HuggingFace Hub에 반영됩니다. 2026년에 새로 시작한다면 레로봇은 최소 저항의 경로입니다. 이 둘 모두에 대한 균일한 PyTorch 인터페이스를 제공합니다. 원래 TFDS 기반 파이프라인을 원한다면 두 데이터 세트는 재생 가능한 다운로드 스크립트를 배포합니다. 우리의 [데이터 플랫폼]
아는 가치가 있는 걸
OXE 액션 공간은 동일하지 않습니다. 공유된 RLDS 스키마 내에서도, 서로 다른 구성 요소는 서로 다른 액션 컨벤션을 사용합니다 (말 효과자 vs 합동, 델타 vs 절대, 서로 다른 지잡기 코딩). OXE 팀은 정상화 계층을 발표했지만 완벽하지는 않습니다. 깨끗한 훈련 실행을 받기 전에 실제 엔지니어링 시간을 사전 처리에 투자할 계획.
DROID 손목 카메라는 저 해상도입니다. 손목 ZED Mini는 720p 스테레오를 제공합니다. 장면 카메라는 1080p를 제공합니다. 대부분의 현대 VLA 아키텍처는 어쨌든 샘플을 하락합니다. 그러나 당신이 높은 해상도 인식을 모델을 훈련하고 있다면 천장을 주의하십시오.
** 둘 다 클래스 불균형을 가지고 있다.** OXE는 몇 개의 큰 구성 요소 (특히 구글 로봇 데이터 세트) 에 의해 지배된다. DROID는 몇 개의 기관이 지배한다. 대부분의 시간을 수집했다. 조심스럽게 혼합.
평가: 각 분야에 대한 교육 정책은 어떻게 비교되는가?
오픈VLA가 출시되었을 때, 그 배제에는 OXE-일 뿐, DROID-일 뿐, OXE+DROID에 훈련된 체크포인트도 포함되었다. 배포 DROID 작업에서는 DROID-일 뿐 체크포인트가 OXE-일 뿐과 경쟁력 있고 때로는 더 좋았다. 배포 밖 평가 (보이지 않는 장면이나 물체) 에서 OXE-일 체크포인트가 더 일반화되었다. 결합된 OXE+DROID 체크포인트는 둘보다 엄격히 더 좋았다. 이것은 현재 표준화된 "OXE 프리트레인, DROID 미세조정" 레시피의 경험적 근거이며, 2025 년까지 그리고 2026 년까지 후속 작업에 걸렸습니다.
DROID은 표준 픽 앤 플레이스를 안정적으로 처리하지만 분포 이외의 모든 것을 처리하는데 어려움을 겪는다. OXE는 더 다양한 작업을 처리하지만 기본의 행동 분포가 구성 요소들 사이에서 정상화되지 않기 때문에 더
저장, 스트리밍 및 실제 다운로드
전체 OXE 코퍼스를 다운로드 하는 것은 멀티테라바이트 작업이다. 대부분의 팀은 신경 쓰지 않습니다. 그들은 TFDS를 통해 관심있는 구성 요소를 스트리밍하거나 스트리밍 모드로 HuggingFace 거울을 사용합니다. DROID는 ~ 1.7 TB 원료로 더 관리 가능합니다. 작은 리그에서 작업하는 경우 HuggingFace LeRobot은 100 궤도 DROID 하위 집합 (DROID-100) 을 배포하고 있으며, 전체 트래닝에 참여하기 전에 프로토타입 파이프라인을 만드는 데 탁월합니다. 생산 훈련에 대한 데이터 로컬
우리가 추천하는 것
2026년, 대부분의 팀들이 배치 가능한 조작 정책을 구축하는 경우, 우리의 조언은: OXE를 통해 훈련된 OpenVLA 또는 pi0 체크포인트에서 시작하여 DROID를 정렬하여 액션 배포를 안정시키고, 그리고 다시 작업에 대한 데이터에 대한 정렬을 수행합니다. 작업에 대한 데이터가 아직 없다면, 우리의 [ 사용자 지정 데이터 수집]
관련 자원
- [X-Embodyment 데이터 세트 페이지를 열]
- [DROID 데이터 세트 페이지]
- [LIBERO vs. CALVIN 기준 비교]
- [브리지데이터와 로보미믹]
- [2026년 최고의 로봇 학습 데이터 집합]
- [VLA 및 정책 모델 목록]
- [로봇스 아카데미 교과서]







