Abriendo el cuerpo X vs DROID: ¿Qué conjunto de datos de robot debería utilizar?
Open X-Embodiment vs DROID: escala de trayectoria, realizaciones, formato de datos, licencia y computación de capacitación comparados. Elija el conjunto de datos robótico modelo de base correcto en 2026.
Open X-Embodiment y DROID son los dos conjuntos de datos de aprendizaje de robots abiertos más grandes en 2026. Están situados en extremos opuestos de un espectro de diseño: Open X-Embodiment es un mega-corpus federado reunido de 33 laboratorios de investigación en 22 tipos de robots diferentes, mientras que DROID es un conjunto de datos de un solo embodo, un solo protocolo recopilado en una Franka Panda a través de cientos de escenas reales. ¿Cuál usar depende de si te importa la escala por la retrabaja o la consistencia por la ajuste fino.
TL;DR
- Conte de trayectoria en bruto: Open X-Embodiment gana
1M+ episodios vs. ~76K de DROID. - ** Diversidad de los cuerpos:** Open X-Embodiment gana
22 tipos de robots frente a la única Franka Panda de DROID. - ** Diversidad de escenas por trayectoria:** DROID gana 564 escenas en 13 instituciones con sensores consistentes.
- ** Consistencia de datos:** DROID gana con un amplio margen
el mismo hardware, la misma cámara, el mismo formato de episodio. - ** Facilidad de formación de una política:** DROID gana
no se necesita normalización de la acción transversal. - Fácil de entrenar un modelo de base: Open X-Embodiment
es sobre lo que RT-X fue construido.
Tabla de comparación entre cabezas
| Attribute | Open X-Embodiment | DROID |
|---|---|---|
| Released | Oct 2023 (Google DeepMind + 33 partners) | Mar 2024 (Stanford / UC Berkeley / TRI + 13 partners) |
| Trajectories | 1,000,000+ episodes | ~76,000 trajectories (~350 hours) |
| Embodiments | 22 robot types (Franka, Google Robot, xArm, WidowX, UR5, etc.) | 1 (Franka Emika Panda with parallel-jaw gripper) |
| Scenes / environments | Mix of labs and uncontrolled environments | 564 scenes across 13 institutions |
| Collection duration | Aggregate of many prior datasets (years) | ~18 months of coordinated collection |
| Cameras | Varies by source dataset | 2x ZED 2 stereo + 1x ZED Mini wrist (consistent) |
| Format | Unified RLDS (TensorFlow Datasets) | RLDS + HDF5; also on HuggingFace / LeRobot |
| Approx. size on disk | Multiple TB (varies by component) | ~1.7 TB raw |
| License | Per-component (mostly CC-BY and Apache-2.0) | MIT + CC-BY-4.0 |
| Reference models | RT-1-X, RT-2-X, OpenVLA, Octo | DROID diffusion policies; used by pi0, OpenVLA fine-tunes |
| Paper | arXiv:2310.08864 | arXiv:2403.12945 |
La brecha en la filosofía del diseño
El Open X-Embodiment (OXE) fue concebido como un experimento de escala: si combinamos todos los conjuntos de datos de manipulación abiertos en un formato estandarizado, ¿podemos entrenar una única política que transfiera a través de 22 robots diferentes? Las trayectorias varían enormemente en calidad, plataformas de cámara, iluminación, frecuencias de acción y convenciones de agarre; consumirlas requiere una normalización cuidadosa a través del esquema RLDS compartido.
DROID tomó el enfoque opuesto. En lugar de agregar datos heterogéneos, DROID estandarizó una sola plataforma de hardware (Franka Panda, dos cámaras ZED 2 para escena, una ZED Mini montada en la muñeca) y la envió a 13 instituciones de investigación. Durante aproximadamente 18 meses, esos laboratorios recogieron alrededor de 76,000 trayectorias silvestres en oficinas, cocinas, laboratorios, pasillos y hogares. Cada trayectoria tiene la misma forma de observación, la misma convención de acción y el mismo formato de anotación lingüística. Esto hace que DROID sea mucho más fácil de entrenar que OXE, y se beneficia en tonos más limpios.
¿Cuándo entrenar en qué
** Pretrain en OXE si** estás construyendo una política generalista de encarnación cruzada. RT-X y OpenVLA son pruebas de existencia de que el preentrenamiento a escala OXE desbloquea comportamientos que ningún conjunto de datos de encarnación individual puede. Si planeas ajustar tu propia encarnación de todos modos, OXE te da el mayor número posible de prioridades.
Ahora bien en DROID si tu hardware objetivo es un Franka Panda o un brazo 7-DoF casi equivalente, o estás entrenando una política de difusión y quieres etiquetas de acción de alta calidad con semántica de agarre consistente. DROID es también la mejor opción si te importa la generalización en el medio silvestre
**Haz ambas cosas si tienes el cálculo. La receta ahora estándar es "OXE pre-train, DROID fine-tune, task demos fine-tune-2." Esto es lo que pi0 y varias políticas humanoides de 2025 usó, y continúa estableciendo el estándar en 2026.
Computación necesaria para entrenar
El OXE pre-entrenamiento en escala OpenVLA (7B parámetros) originalmente utilizó 64 GPU A100 durante aproximadamente dos semanas. Eso es un costo de capital real
Para inferir, ambos conjuntos de datos producen políticas que funcionan cómodamente en una GPU de consumo. No recomendamos entrenamiento desde cero en ninguno de los conjuntos de datos a menos que tengas una razón de investigación específica; los puntos de control preentrenados en HuggingFace son puntos de partida extremadamente fuertes.
Licencia: leer la letra pequeña
OXE es un registro de conjuntos de datos de componentes, cada uno con sus propios términos. La mayoría de los componentes son CC-BY-4.0 o Apache-2.0, lo que significa que puede entrenar modelos comerciales sobre ellos y enviar pesos derivados. Un puñado de componentes son solo de investigación; si está construyendo un producto, audite la lista de componentes en función de su postura legal. DROID es sencillo
Formatos de datos y herramientas
Ambos conjuntos de datos utilizan RLDS como formato canónico, y ambos se reflejan en HuggingFace Hub a través del ecosistema LeRobot. Si estás comenzando de nuevo en 2026, LeRobot es el camino de menor resistencia. Nuestra [plataforma de datos]
Gotchas que vale la pena conocer
Los espacios de acción de OXE no son idénticos. Incluso dentro del esquema RLDS compartido, los diferentes componentes utilizan diferentes convenciones de acción (efector final vs conjunto, delta vs absoluto, codificación de agarre diferente).
Camera de pulsera DROID es de baja resolución. La cámara de pulsera ZED Mini ofrece 720p de estéreo; las cámaras de escena ofrecen 1080p. La mayoría de las arquitecturas VLA modernas son de baja resolución de todos modos, pero si estás entrenando un modelo de percepción de alta resolución, ten en cuenta el techo.
Ambos tienen un desequilibrio de clases. OXE está dominado por un puñado de componentes grandes (especialmente los conjuntos de datos de Google Robot).
Evaluar: ¿cómo se comparan las políticas formadas en cada uno?
Cuando OpenVLA fue lanzado, sus ablaciones incluían puestos de control entrenados en OXE-solo, DROID-solo y OXE+DROID. En las tareas DROID en distribución, el puesto de control DROID-solo era competitivo con OXE-solo, a veces mejor. En la evaluación fuera de distribución (escenas o objetos no vistos), el puesto de control OXE-solo se generalizó aún más. Esta es la base empírica para la reciba ahora estándar "OXE pre-train, DROID fine-tune", y ha mantenido en el trabajo de seguimiento hasta 2025 y hasta 2026.
La brecha es particularmente pronunciada en los comportamientos de cola larga. DROID solo maneja el pick-and-place estándar de manera confiable pero lucha en cualquier cosa fuera de su distribución. OXE solo maneja una variedad más amplia de tareas pero produce rastros de acción más rotos porque las distribuciones de acción subyacentes no se normalizan entre los componentes. Combinando los dos suaviza ambos modos de falla.
Almacenamiento, transmisión y descarga práctica
La descarga del corpus completo de OXE es una operación de varios terabytes. La mayoría de los equipos no se molesta
Lo que recomendamos
Para la mayoría de los equipos que construyen una política de manipulación desplegable en 2026, nuestro consejo es: comenzar desde un punto de control OpenVLA o pi0 pre-entrenado por OXE, ajustar a DROID para estabilizar las distribuciones de acción, y luego ajustar de nuevo a sus propios datos de teleoperación específicos de tareas. Si aún no tiene datos específicos de tareas, nuestra [recolección de datos personalizados]
Recursos relacionados
- [Abre la página del conjunto de datos del cuerpo X]
- [Página del conjunto de datos DROID]
- [Comparación de índice de referencia LIBERO vs. CALVIN]
- [BridgeData vs RoboMimic]
- [Mejores conjuntos de datos de aprendizaje de robots en 2026]
- [Catálogo de VLA y modelos de política]
- [Tutoriales de la Academia de Robótica]







