Volver a Blog

ALOHA vs UMI: ¿Qué sistema de recopilación de datos es adecuado para usted?

Comparación en profundidad de los sistemas de recogida de datos ALOHA y UMI para el aprendizaje de imitación de robots.

La recopilación de datos de demostración de alta calidad es el cuello de botella para el aprendizaje de imitación. Se han convertido en dos sistemas como los enfoques dominantes: ALOHA (teleoperación bilateral líder-seguidor) y UMI (Interfaz de Manipulación Universal, un dispositivo de recopilación de datos portátil). Resolven el mismo problema, capturando demostraciones de manipulación humana, a través de mecanismos fundamentalmente diferentes, y la elección correcta depende de su tarea, tamaño del equipo, objetivo de implementación y presupuesto. Esta guía proporciona una comparación técnica detallada para ayudarlo a decidir.

Cómo funciona ALOHA

ALOHA leader-follower teleoperation arms

[ALOHA] (A Low-cost Open-source Hardware System for Bimanual Teleoperación) utiliza pares iguales de brazos robóticos en una configuración líder-seguidor. El operador mueve físicamente los brazos del líder, y los brazos del seguidor reflejan esos movimientos en tiempo real. Los codificadores conjuntos en ambos brazos del líder y seguidor registran trayectorias de posición sincronizadas a 50Hz, junto con imágenes de la cámara de muñeca y la cámara superior.

Mehcanismo clave: Los brazos del líder y del seguidor son cinemáticamente idénticos (ambos son brazos ViperX 300 6-DOF con servos Dynamixel). Cuando el operador mueve una articulación del brazo del líder, la articulación del brazo del seguidor correspondiente se mueve para coincidir. Este mapeo 1:1 significa que el operador siente directamente las interacciones del brazo seguidor con los objetos a través de la retroalimentación servo del brazo líder - no la retroalimentación de la fuerza verdadera, sino suficiente acoplamiento posicional que los operadores experimentados desarrollen un sentido intuitivo del contacto.

** Formatos de datos:** ALOHA registra posiciones conjuntas (14 valores: 6 articulaciones + 1 agarre por brazo), velocidades de articulación, imágenes de cámara (generalmente 2-4 cámaras a 480p/30fps) y sellos de tiempo. Los datos son nativos de robots: las trayectorias conjuntas se pueden reproducir directamente en los brazos de seguidores o utilizar para entrenar políticas sin ningún paso de retargeting.

Vantaje bimanual: La característica definitorio de ALOHA es la teleoperación bilateral - ambos brazos se controlan simultáneamente. Esto permite la recopilación de datos para tareas bimanual (abrir un frasco mientras lo sostiene, doblar tejido, verter de una botella en una taza) que son imposibles de demostrar con sistemas de un solo brazo. La arquitectura de políticas de ACT fue diseñada específicamente para manejar el espacio de acción bimanual de ALOHA.

Cómo funciona la UMI

RCSV UMI handheld data collection device

El [UMI (Interfaz de Manipulación Universal) T4) es un agarre portátil con cámaras e IMU. El operador sostiene el UMI como una herramienta y realiza la tarea de manipulación directamente - ningún brazo robótico está presente durante la recopilación de datos. El seguimiento externo (marcadores ArUco o SLAM) capta la posición de 6 DOF de la UMI en el entorno, mientras que la cámara de bordo registra la vista del agarre y el codificador de dedos registra la apertura del agarre.

** Mecanismo clave:** UMI desacopla la recopilación de datos del hardware del robot. El operador trabaja a velocidad y destreza humana, sin restricciones de la cinemática del robot, los límites del espacio de trabajo o el ancho de banda de servo. Este paso de retargeting convierte las trayectorias de la posición cartesiana en trayectorias de ángulo conjunto para el brazo robótico específico que se está utilizando.

Formático de datos: UMI registra la posición de 6-DOF del efecto final (posición + orientación), la apertura del agarre, las imágenes de la cámara de muñeca y las estampillas de tiempo. Antes del entrenamiento, las trayectorias deben ser retargetadas al robot objetivo - un paso computacionalmente ligero pero que introduce 2-5 mm de error de posición del efecto final debido a la aproximación IK y las diferencias cinemáticas.

Vantaje de portabilidad: UMI se puede utilizar en cualquier lugar: cocina, planta de fábrica, oficina, al aire libre. El operador no necesita un robot, una estación de trabajo o cualquier infraestructura más allá del dispositivo UMI y una computadora portátil. Esto permite la recopilación de datos en el entorno de implementación real, con iluminación real, desorden y variación de objetos, produciendo datos de capacitación más diversos que la recopilación en laboratorio.

Dex-UMI: extensión dexterosa

RCSV Dex-UMI dexterous manipulation data collection glove

[Dex-UMI]T5) extiende la UMI a la manipulación hábil. En lugar de un agarre paralelo de mandíbula, Dex-UMI utiliza un guante instrumentado que captura los ángulos de articulación individual del dedo (20+ DOF), las fuerzas de contacto de la punta del dedo y la posición de la muñeca. Esto permite la recopilación de datos para tareas que requieren coordinación de varios dedos: agarres de pincha, reorientación en la mano, manipulación de herramientas y ensamblaje fino.

Cuándo utilizar Dex-UMI: Si su robot de despliegue tiene una mano destre (Mano LEAP, Allegro Hand o un efector final multi-dedo similar) y sus tareas requieren control a nivel de los dedos, Dex-UMI es la única opción portátil de recopilación de datos. Dex-UMI llena la brecha entre las demostraciones simples del agarre y los datos de manipulación completos y hábiles.

Decisión rápida

¿Necesita de un manual? → ALOHA. ¿Necesita de portabilidad? → UMI. ¿Necesita de destreza? → Dex-UMI.

Comparación entre cabezas

Criterion ALOHA UMI Dex-UMI
Cost $3,000-$4,000 (full system) $800 per unit $1,200 per unit
Setup time 2-4 hours (assembly + calibration) 15-30 minutes 30-45 minutes
Operator training 2-4 hours (bimanual coordination) 10-15 minutes 30-60 minutes
Demos per hour 20-60 (single system) 60-100 per operator 40-70 per operator
Parallelizable No (1 operator per system) Yes (N operators = N units) Yes (N operators = N units)
Data quality High (robot-native joints) Medium (retargeting error) Medium (finger retargeting)
Retargeting needed No Yes (IK solve) Yes (finger mapping + IK)
Bimanual support Native (2 arms) Limited (2 UMIs, no sync) No
Portability Low (robot + table + power) High (handheld + laptop) High (glove + laptop)
Dexterous tasks No (1-DOF gripper) No (1-DOF gripper) Yes (20+ DOF fingers)
Environment diversity Low (fixed lab setup) High (any location) High (any location)
Policy frameworks ACT, Diffusion Policy, LeRobot Diffusion Policy, ACT (retargeted), VLA Diffusion Policy, custom

La calidad de los datos: la diferencia crítica

ALOHA produce trayectorias articulares nativas del robot. Cuando el operador mueve el brazo líder a la posición X, el codificador del brazo seguidor registra los ángulos articulares precisos necesarios para alcanzar la posición X. Estos datos se pueden reproducir en el brazo seguidor o utilizar directamente para el entrenamiento de políticas sin ninguna transformación. La única fuente de ruido es la servocuantización y la reacción negativa, que es pequeña (0,1-0,3 grados por articulación para la serie Dynamixel XM).

UMI produce trayectorias cartesianas de efectos finales que deben ser retargetadas al robot de despliegue. El paso de retargeting introduce el error de tres fuentes: (1) aproximación del solvente IK (el solvente puede no encontrar la misma configuración exacta que el robot usaría naturalmente), (2) desajuste cinemático entre el brazo del operador humano y el brazo del robot (distancia de enlace, límites de articulación, forma del espacio de trabajo) y (3) seguimiento del ruido de la estimación de la posición externa (los marcadores ArUco tienen ruido de posición de 1-3 mm dependiendo de la distancia y la iluminación).

En la práctica: Para tareas con tolerancia de posicionamiento superior a 5 mm (la mayor parte de pick-and-place, vertido, mezcla), el error de retargeting UMI es insignificante y ambos sistemas producen un rendimiento de política equivalente. Si la precisión es crítica, utilice ALOHA o complete los datos de UMI con un conjunto más pequeño de demostraciones en robot para el ajuste fino.

Recopilación de datos de escala: donde gana la UMI

La ventaja fundamental de la escala de UMI es el paralelismo. Un sistema ALOHA puede recopilar datos de un operador a la vez. Diez dispositivos UMI pueden recopilar datos de diez operadores simultáneamente, en diez entornos diferentes, produciendo diez veces la diversidad de datos por unidad de tiempo.

Comparación de costes por demostración:

  • ALOHA: Sistema de 4.000 dólares, 40 demostraciones/hora, costo del operador de 100 dólares/hora = 2,50 dólares por demostración amortizada (excluyendo la amortización del hardware).
  • UMI (single): $800 dispositivo, 80 demostraciones/hora, $30/hora costo del operador (no experto) = $0.38 por demostración.
  • UMI (10 dispositivos, 10 operadores): $8,000 hardware total, 800 demos/hora, $300/hora costo total del operador = $0.39 por demostración, pero 20 veces el rendimiento.

Para los proyectos que requieren miles de demostraciones (entrenamiento VLA, conjuntos de datos multitareales, generalización transversal del entorno), los beneficios de costes y rendimiento de UMI son decisivos.

Marco de decisión sobre el tipo de tarea

Utilice este árbol de decisión para elegir entre ALOHA y UMI para su tarea específica:

  1. ** ¿Requiere su tarea dos brazos simultáneamente?** Si es así: ALOHA. UMI no puede capturar datos bimanual sincronizados. Ejemplos: plegar la ropa, abrir un frasco, ensamblaje de dos manos.
  2. ** ¿Requiere su tarea una manipulación dexterosa de los dedos?** Si es así: Dex-UMI. Ni ALOHA ni UMI estándar capturan datos de varios dedos. Ejemplos: uso de herramientas, reorientación en la mano, manipulación de pluma.
  3. ¿Necesitas datos de diversos entornos del mundo real? Si es así: UMI. La recopilación de datos en 20 cocinas diferentes produce políticas más robustas que la recopilación de 20 veces más datos en un laboratorio. Ejemplos: tareas de robots domésticos, recopilación de objetos en diferentes desorden.
  4. ¿Necesita más de 1.000 demostraciones? Si es así: UMI. La escalación paralela hace que los grandes conjuntos de datos sean económicamente viables. Ejemplos: ajuste fino de VLA, capacitación multitarefa, generalización transversal.
  5. ** ¿Requiere su tarea una precisión inferior a 2 mm?** Si es así: ALOHA (o teleoperación en robot). El error de retargeting en los datos UMI degrada las tareas de precisión. Ejemplos: inserción de peg, apareamiento de conectores, montaje de tablas de circuito.
  6. ** ¿Se desplegará en el hardware ALOHA? ** Si es así: ALOHA. El error de retargeting cero significa el mejor rendimiento posible de las políticas en este hardware específico.
  7. Para todo lo demás: Comience con UMI por su velocidad y flexibilidad, luego complete con demostraciones en robot si el rendimiento de la política es despejado.

Combinación de ALOHA y UMI

Las estrategias de recopilación de datos más eficaces utilizan ambos sistemas.

  1. Fase 1 - UMI para amplitud (semanas 1-2): Implemente dispositivos UMI para recopilar entre 500 y 2,000 demostraciones en diversos entornos, objetos y operadores. Esto construye el conjunto de datos de base con alta variación. Utilice operadores no expertos (entrenamiento mínimo) para capturar la ejecución natural de tareas.
  2. Fase 2 -- ALOHA para la profundidad (semanas 3-4): Utilice ALOHA para recopilar 100-300 demostraciones de alta calidad de las subtareas más difíciles identificadas en la Fase 1.
  3. Fase 3 -- Co-formación: Entrenamiento de la política sobre el conjunto de datos combinado, ponderación de las demostraciones ALOHA más alto para los segmentos de tareas críticas de precisión.

Este enfoque combinado generalmente produce un rendimiento político 15-30% mejor que cualquiera de los sistemas solos, porque combina la diversidad ambiental de UMI con la precisión robótica nativa de ALOHA.

Compatibilidad con el hardware

Tanto los datos de ALOHA como los de UMI pueden capacitar políticas para el despliegue en una amplia gama de brazos robóticos.

Deployment Robot ALOHA Data UMI Data Notes
Mobile ALOHA Native (zero retargeting) Retarget via IK Best results with ALOHA data
OpenArm Retarget (different kinematics) Retarget via IK Both require retargeting; UMI more natural
Franka FR3 Retarget (different kinematics) Retarget via IK 7-DOF IK has more solutions; quality depends on solver
UR5e Retarget (different kinematics) Retarget via IK UR analytical IK gives deterministic retargeting
AgileX Piper Retarget (different kinematics) Retarget via IK Shorter reach may clip some UMI trajectories

Comparación de configuración de la cámara

La configuración de las cámaras difiere significativamente entre los dos sistemas, lo que afecta a las observaciones visuales disponibles para la formación de políticas.

Las cámaras de muñeca se mueven con el brazo, proporcionando una visión coherente del agarre-ojo. Las cámaras de muñeca se fijan. Todas las cámaras están calibradas en relación con el marco de base del robot, proporcionando relaciones espaciales consistentes entre las observaciones visuales y las posiciones conjuntas.

Cámaras de pulsera de UMI: Una cámara de pulsera de bordo por dispositivo UMI, más cámaras externas opcionales. La cámara de pulsera está rígidamente montada en el agarre y proporciona la misma visión del agarre que las cámaras de pulsera de ALOHA. Las cámaras externas, si se utilizan, deben calibrarse con el marco de marcador ArUco para cada sesión de recogida. La diferencia clave: las cámaras externas de UMI ven la mano y el brazo del operador, no un robot, por lo que las políticas entrenadas en la visión de terceros de UMI deben generalizarse desde la apariencia de la mano humana a la apariencia del brazo robótico en el momento de su despliegue.

** Recomendación práctica:** Para las políticas de solo visualización de la cámara de muñeca (ACT con vista de muñeca, Política de difusión ojo en mano), ALOHA y UMI producen datos visuales equivalentes. Si utiliza UMI con cámaras de tercera persona, entrena solo en vistas de la cámara de muñeca, o use la aleatorización de dominio para cerrar la brecha de apariencia.

El RC G1 Guante táctil como capa de aumento de datos

El [RC G1 Táctil Guante]T14) añade la detección táctil a cualquier flujo de trabajo de recopilación de datos. Cuando se usa durante la teleoperatoria ALOHA, registra las fuerzas de contacto de los dedos del operador en los sujetadores del brazo del líder. Cuando se usa durante la recopilación de UMI, registra las fuerzas de los dedos en el mango de la UMI. Estos datos táctiles pueden entrenar políticas que reaccionan a fuerzas de contacto -- detectando deslizamiento, modulación de fuerza de agarre, o detección de rigidez de objetos -- capacidades más allá de lo que solo proporcionan las políticas de visión.

Preguntas frecuentes

¿Cuál es la diferencia entre ALOHA y UMI?

ALOHA es un sistema bilateral de teleoperatorio líder-seguidor en el que el operador controla los brazos robóticos coincidentes para realizar tareas mientras que los brazos seguidores registran las trayectorias conjuntas. ALOHA capta datos conjuntos nativos entre robots; UMI capta trayectorias del espacio de tareas que deben ser redireccionadas al robot de despliegue.

¿Es mejor para la recopilación de datos ALOHA o UMI?

Depende de su caso de uso. ALOHA es mejor cuando necesita datos bimanual, trayectorias conjuntas nativas de robots o está implementando en el hardware ALOHA. UMI es mejor cuando necesita portabilidad (recolectar datos en cualquier lugar sin un robot), desea paralelalizar la recopilación de datos en muchos operadores no expertos o planea implementar en múltiples plataformas de robots. Los datos de la UMI requieren una etapa de retargeting; los datos de ALOHA están listos para su formación inmediatamente.

¿Cuánto cuesta ALOHA vs UMI?

El sistema completo (de 2 brazos líder + 2 brazos seguidores + base móvil) cuesta aproximadamente $4,000. El ALOHA estacionario (de 4 brazos ViperX sin la base) cuesta aproximadamente $3,000. El [RCSV UMI]T16) cuesta $800 por unidad, y se pueden desplegar múltiples unidades simultáneamente para la recopilación de datos paralelos.

¿Puedo utilizar los datos de la UMI para formar políticas para ALOHA?

Sí, pero requiere retargeting de trayectoria. UMI captura poses de efectos finales en el espacio cartesiano, que deben convertirse en ángulos conjuntos para los brazos ALOHA utilizando cinemática inversa. Esta retargeting introduce algún error (generalmente 2-5 mm error de posición del efecto final) pero es adecuado para la mayoría de las tareas de manipulación. LeRobot y la [Plataforma de Datos Sin Temor]T17) ambos soportan retargeting UMI-to-ALOHA.

¿Qué es Dex-UMI?

[Dex-UMI] ((T18) es la versión de manipulación dexterosa de UMI. En lugar de capturar datos de agarre paralelo de mandíbula, Dex-UMI utiliza un guante instrumentado para capturar demostraciones de múltiples dedos: posiciones individuales de los dedos, fuerzas de contacto y posición de la muñeca. Permite la recopilación de datos para tareas hábiles (uso de herramientas, reorientación manual) que el UMI y ALOHA estándar no pueden capturar.

¿Cuántas demostraciones puedo recoger por hora con ALOHA vs UMI?

ALOHA: 20-40 demostraciones bimanual por hora, o 40-60 demostraciones de un solo brazo por hora. La configuración líder-seguidor requiere que el robot esté físicamente presente y encendido. UMI: 60-100 demostraciones por hora por operador, y se puede ejecutar múltiples operadores simultáneamente. Un equipo de 5 operadores con dispositivos UMI puede recoger 300-500 demostraciones por hora, lo que es imposible de combinar con un solo sistema ALOHA.

Relacionado: Mejores robots para el aprendizaje de imitación 2026 · Guía de robots de ALOHA · Configuración de ALOHA móvil · Política de ACT explicada · Tienda de RCSV