Volver a Guides

Robot ALOHA: Sistema de Teléoperación Bimanual de código abierto de Stanford

Guía completa de robots ALOHA: lo que es, BOM completo y costo ($ 17K-$ 32K), configuración con ROS2 y ACT, entrenamiento de tareas bimanual, y alternativas rentables a partir de $ 4,500.

[← Guías]

Todo lo que necesitas saber sobre ALOHA, la plataforma que hizo que el aprendizaje bimanual de robots fuera accesible a todos los laboratorios, desde la arquitectura y el costo hasta la configuración, la capacitación y las alternativas.

¿Qué es ALOHA?

ALOHA se refiere a Un sistema de hardware de código abierto de bajo costo para la teleoperación bimanual. Fue desarrollado en la Universidad de Stanford por Tony Zhao, Vikash Kumar, Sergey Levine y Chelsea Finn, y se introdujo en el artículo de 2023 "Aprender Manipulación Bimanual de Granos Finales con Hardware de Bajo Costo" junto con ACT (Action Chunking with Transformers), el algoritmo de aprendizaje de imitación diseñado para trabajar con datos ALOHA.

Antes de ALOHA, la investigación de manipulación bimanual requería robots industriales caros (dos Pandas Franka Emika a $80,000 + o un Baxter a $ 25,000) y una amplia ingeniería personalizada. ALOHA demostró que dos brazos robóticos de grado de consumo en una configuración de líder-seguidor podrían recopilar datos de demostración bimanual de alta calidad que entrenan políticas de manipulación efectivas - a aproximadamente una décima parte del costo de los sistemas anteriores.

El sistema ha sido replicado por docenas de laboratorios en todo el mundo y ha generado varias variantes, en particular ** Mobile ALOHA** (agrega una base de ruedas para la teleoperatoria de todo el cuerpo) y ALOHA 2 (versión mejorada de Google DeepMind con mejores tolerancias de hardware).

Por qué ALOHA es importante

El significado de ALOHA no es el hardware en sí mismo, es básicamente dos brazos robóticos fuera de la plataforma atados a una mesa. Su impacto proviene de tres contribuciones:

  • ** Recopilación de datos bimanual democratizada.** El diseño líder-seguidor permite a cualquier operador humano demostrar tareas bimanual sin programación. El operador sostiene los brazos del líder y realiza la tarea de manera natural; los brazos del seguidor reflejan el movimiento mientras las cámaras registran observaciones. Esto produjo los primeros conjuntos de datos de demostración bimanual a gran escala a un costo accesible a los laboratorios universitarios.
  • Acción con transformadores (ACT). El algoritmo ACT, introducido en el mismo documento, predice pedazos de 100 acciones futuras a la vez en lugar de una acción a la vez. Esto reduce dramáticamente los errores compuestos que plagaron a los enfoques de aprendizaje de imitación anteriores, logrando tasas de éxito del 80-90% en tareas en las que los métodos anteriores alcanzaron el 20-40%.
  • Reproducibilidad de código abierto. Cada componente - archivos CAD, BOM, controladores ROS2, scripts de grabación de datos, código de capacitación ACT y modelos pre-entrenados - está disponible al público. Esto permitió una rápida adopción e iteración en toda la comunidad robótica.

ALOHA estacionaria vs ALOHA móvil

La plataforma ALOHA existe en dos configuraciones principales.

Feature Stationary ALOHA Mobile ALOHA
Base Fixed table mount AgileX Tracer wheeled base
Follower arms 2x ViperX 300 S2 2x ViperX 300 S2
Leader arms 2x WidowX 250 S 2x WidowX 250 S
Action space 14-DOF (7 per arm) 16-DOF (14 arm + 2 base velocity)
Cameras 2 wrist + 1 overhead 2 wrist + 1 overhead + 1 side (optional)
Hardware cost $17,000-22,000 $28,000-35,000
Setup time 2-4 weeks 4-8 weeks
Best for Tabletop bimanual tasks Tasks requiring locomotion + manipulation

Para la mayoría de los equipos, el ALOHA estacionario es el punto de partida adecuado. ALOHA móvil añade $10,000-15,000 en costo y complejidad de integración significativa para la capacidad de movilidad. Si sus tareas ocurren en una sola estación de trabajo - ensamblaje, embalaje, preparación de la cocina, manipulación de laboratorio - ALOHA estacionario (o una alternativa compatible con ALOHA como el [OpenArm DK1] T8)) es suficiente.

Para obtener una descripción detallada de los costes de la variante móvil, consulte nuestra Disminución de costes ALOHA móvil.

Arquitectura del sistema ALOHA

Comprender la arquitectura de ALOHA te ayuda a evaluar si construir una, comprar una alternativa o externalizar la recopilación de datos por completo.

Hardware: Teléoperación de seguidores y líderes

ALOHA utiliza una configuración líder-seguidor (también llamada maestro-esclavo).

  • ** brazo de seguimiento (ViperX 300 S2):** El brazo robot que ejecuta tareas e interactúa con objetos. Tiene 6 DOF más un agarre (7 en total), utiliza servos de la serie Dynamixel XM / XH, y tiene una carga útil de 750g en extensión completa. Durante la teleoperatoria, refleja las posiciones articulares del brazo líder a 50 Hz.
  • ** brazo de líder (WidowX 250 S):** El brazo sostenido y movido por el operador humano. Es más ligero y de menor alcance que el seguidor, lo que lo hace cómodo para manipular para sesiones de recopilación de datos extendidas. Proporciona retroalimentación de la fuerza a través de la compensación de gravedad - los servos sostienen el propio peso del brazo, por lo que el operador solo siente la inercia de sus movimientos intencionales.

El brazo líder y el brazo seguidor se conectan a través de USB a la misma computadora de bordo a través de adaptadores Dynamixel U2D2. El bucle de control lee las posiciones conjuntas del brazo líder a 50 Hz y envía comandos de posición correspondientes al brazo seguidor. La latencia total de extremo a extremo debe permanecer por debajo de 10 ms para una teleoperación transparente (el operador no debe sentir retraso entre sus movimientos y la respuesta del seguidor).

Sistema de cámara

ALOHA utiliza cámaras de profundidad Intel RealSense en tres posiciones:

  • Dos cámaras de muñeca (RealSense D405): Montadas en las muñecas del brazo de seguimiento, proporcionando vistas de cerca del espacio de trabajo de manipulación.
  • Una cámara aérea (RealSense D435): Montada sobre el espacio de trabajo, proporcionando una vista de arriba hacia abajo para el contexto espacial.

Las tres cámaras deben ser sincronizadas temporalmente (dentro de 10 ms) para que los datos grabados entrenen políticas efectivas. El cable de sincronización Intel Multi-Camera proporciona sincronización a nivel de hardware.

Computación de la pila

La computadora de bordo (normalmente una Intel NUC o mini-PC equivalente) realiza tres tareas simultáneamente:

  1. Control en tiempo real: Leer posiciones conjuntas del líder y posiciones conjuntas del seguidor a 50 Hz a través del servobus Dynamixel.
  2. Cacta de cámara: Grabación de marcos RGB sincronizados de tres cámaras a 30 fps.
  3. Registro de datos: Escribir todos los datos de los sensores (posiciones conjuntas, velocidades, marcos de cámara, sellos de tiempo) en archivos HDF5 para entrenamiento posterior.

No se necesita GPU en el robot. La capacitación de políticas se realiza fuera de línea en una estación de trabajo separada (RTX 4090 o GPU en la nube). La implementación de políticas (inferencia) puede ejecutarse en la CPU de la NUC para los modelos ACT, que requieren menos de 10 ms por pase avanzado.

Desglose de costes ALOHA estacionario

La configuración ALOHA estacionaria (sin base móvil) es significativamente más barata y más rápida de construir.

Component Cost Notes
2x ViperX 300 S2 follower arms $9,600 $4,800 each, Dynamixel XM/XH servos
2x WidowX 250 S leader arms $6,200 $3,100 each, lighter weight for operator comfort
2x Custom gripper assemblies $400-800 Parallel-jaw with Dynamixel XL330
3x Intel RealSense cameras $950 2x D405 wrist ($300 ea) + 1x D435 overhead ($350)
Intel NUC 13 Pro (onboard computer) $800-1,200 i7, 32GB RAM, 1TB NVMe
U2D2 adapters, USB hub, cables $350-500 4x U2D2 ($50 ea), powered USB hub, cabling
Mounting hardware, table clamps $200-400 Camera mast, arm base plates, clamps
Stationary ALOHA total $18,500-19,700 Hardware only, before labor
Training workstation (RTX 4090) $2,000-3,000 Separate desktop for offline training
Complete system total $20,500-22,700 Excluding integration labor

Esto representa el costo mínimo para un ALOHA estacionario totalmente funcional. Agregue $ 2,000-5,000 para el montaje profesional si está subcontratando la construcción. Para la variante móvil, agregue $ 10,000-15,000 para la base AgileX, el marco de montaje, la batería adicional y la integración. Consulte nuestro [desglose detallado de costos de ALOHA móvil]T10) para el BOM móvil completo.

Estaca de software

La pila de software ALOHA tiene cuatro capas, cada una de código abierto y bien documentada.

1. ROS2 Humble (control en tiempo real)

ROS2 Humble en Ubuntu 22.04 proporciona la capa de comunicación.

  • Paquetes Interbotix ROS2: Conductores para los brazos ViperX y WidowX. Proporcionan una suscripción conjunta de comandos de publicación y posición en 50 Hz.
  • Envase de RealSense ROS2: Los nodos de conductor de cámara publican imágenes RGB y profundidad a 30 fps.
  • Nodo de teleoperación: Leer las posiciones de los brazos del líder y enviar comandos de coincidencia a los brazos seguidores a 50 Hz.
# Install ROS2 Humble and ALOHA dependencies
sudo apt install ros-humble-desktop python3-colcon-common-extensions

# Install Interbotix arm drivers
curl 'https://raw.githubusercontent.com/Interbotix/interbotix_ros_manipulators/main/interbotix_ros_xsarms/install/amd64/xsarm_amd64_install.sh' > xsarm_install.sh
chmod +x xsarm_install.sh && ./xsarm_install.sh -d humble

# Install RealSense drivers
sudo apt install ros-humble-librealsense2* ros-humble-realsense2-camera

2. Repositorio ALOHA (Teleoperación y grabación)

El repositorio oficial de ALOHA GitHub proporciona scripts para la teleoperación líder-seguidor y la grabación de datos sincronizada. Se ocupa de la tarea crítica de alinear los datos de estado conjunto (50 Hz) con los marcos de la cámara (30 fps) en episodios HDF5 con sello de tiempo. Cada episodio contiene:

  • T2: forma (T, 14) -- posiciones conjuntas comandadas (7 por brazo)
  • T3: forma (T, 14) -- posiciones de las articulaciones medidas
  • T4: forma (T, 480, 640, 3) -- cámara aérea
  • T5: forma (T, 480, 640, 3)
  • T6: forma (T, 480, 640, 3)

3. Código de formación del ACT (aprendizaje de políticas fuera de línea)

ACT (Action Chunking with Transformers) es el algoritmo de entrenamiento predeterminado para los datos ALOHA.

  • Encodificador: Procesan las observaciones actuales (posiciones conjuntas + imágenes de cámara) a través de un codificador de imágenes ResNet-18 y un MLP de estado conjunto.
  • ** Decodificador:** Un decodificador de transformador con un CVAE (Conditional Variational Codificador Automático) que predice una pieza de 100 acciones futuras a la vez.
  • ** Ensamble temporal:** Durante el despliegue, los trozos de acción superpuestos se promedian con ponderación exponencial, suavizando las transiciones entre predicciones sucesivas.
# Train ACT policy on ALOHA data using LeRobot
python lerobot/scripts/train.py \
  policy=act \
  dataset_repo_id=your-username/aloha-task \
  env=aloha \
  training.num_epochs=2000 \
  training.batch_size=8 \
  policy.chunk_size=100 \
  policy.kl_weight=10

4. LeRobot (Layer de Integración Moderna)

[LeRobot]T11) de Hugging Face se ha convertido en la capa de integración estándar para el hardware de la clase ALOHA. Proporciona grabación de datos estandarizada, gestión de conjuntos de datos (push to HuggingFace Hub), tuberías de entrenamiento para ACT/Diffusion Policy/TDMPC2, y scripts de implementación. Para las nuevas edificaciones de ALOHA, recomendamos usar LeRobot desde el principio en lugar de los scripts de repositorio ALOHA originales.

Guía de configuración

La construcción y configuración de un sistema ALOHA implica cinco fases. Para obtener instrucciones detalladas paso a paso, consulte nuestra Guía de configuración de ALOHA móvil (que cubre las configuraciones estacionarias y móviles).

Fase 1: Ensamblaje de hardware (3-5 días)

Montar los brazos de seguidores a la mesa o el marco, instalar los brazos de líder a la altura del operador, montar agarradores, montar cámaras y conectar toda la electrónica. Detalles críticos: las placas de base del brazo deben ser co-planares a menos de 1 mm; la montaje de la cámara debe ser rígida (cualquier flexión produce datos inconsistentes). Torque todos los tornillos a la especificación y aplicar un cordón a las articulaciones propensas a las vibraciones.

Fase 2: Configuración y calibración de ROS2 (3-7 días)

Instale Ubuntu 22.04, ROS2 Humble, controladores Interbotix y controladores RealSense. Configure los parámetros de servo de Dynamixel: configure la velocidad de baud a 1M, calibre las posiciones cero para cada unión, configure ganancias PID y configure la compensación de gravedad en los brazos del líder. Verifique el orden de enumeración del dispositivo USB (esta es una fuente común de errores cuando los dispositivos se reasignan después del reinicio).

Fase 3: Primera prueba de teleoperatoria (1-2 días)

Ejecutar el nodo de teleoperación y verificar que ambos pares de brazos rastrean correctamente. Compruebe: latencia líder a seguidor (debe ser inferior a 10 ms), precisión de seguimiento (el seguidor debe coincidir con la posición del líder a menos de 2 grados), sincronización de agarre (estados abiertos / cerrados coinciden) y alimentación de cámara (las tres cámaras producen marcos limpios a 30 fps).

Fase 4: Grabación de las demostraciones (en curso)

Definir su tarea, configurar el script de grabación y comenzar a recopilar demostraciones. Comience con una simple tarea de validación (pick and place) para verificar la línea completa antes de invertir tiempo en tareas complejas. Recoge 50 demostraciones para la tarea de validación, entrene una política y evalúe. Objetivo: 60% + tasa de éxito. Si es inferior al 40%, deshacerse del hardware / calibración antes de recopilar más datos.

Fase 5: Política de formación ACT (4-8 horas por carrera de formación)

Empuje su conjunto de datos a HuggingFace Hub (o tren localmente), configure los hiperparámetros ACT y entren. Hiperparámetros clave: chunk_size=100, kl_weight=10, lot_size=8, num_epochs=2000. Observe pérdida de validación - el entrenamiento se realiza cuando se producen plateaos de pérdida durante más de 200 épocas. Implemente la política entrenada de nuevo en el robot para la evaluación.

Indicadores de rendimiento

Estas tasas de éxito son del documento original de ACT (Zhao et al., 2023) y las publicaciones posteriores de ALOHA. Sus resultados variarán en función de la calidad de calibración del hardware, el número de demostraciones y la habilidad del operador.

Task Success Rate Demos Used Notes
Slot insertion (bimanual) 91% 50 One arm holds socket, other inserts battery
Fork retrieval from pot 82% 50 Requires precise grasp in confined space
Coffee making (multi-step) 62% 50 Long-horizon, 5+ sequential sub-tasks
Table bussing (mobile) 85% 50 mobile + 370 static Mobile ALOHA with co-training
Door opening (mobile) 76% 50 mobile + 370 static Whole-body coordination required
Object handover to human (mobile) 68% 50 mobile + 370 static Requires detecting human presence and timing

Creo clave de los puntos de referencia: La co-entrenamiento es muy importante para las tareas móviles. Las tareas móviles anteriores utilizaron solo 50 demostraciones móviles, pero fueron co-entrenadas con 370 demostraciones bimanual estáticas. Esto significa que puede recopilar la mayor parte de sus datos en una configuración estacionaria más barata y agregar una pequeña cantidad de datos móviles para obtener políticas móviles.

ALOHA Alternativas de comparación

Varios sistemas ofrecen una capacidad de teleoperación bimanual similar a la de ALOHA a diferentes precios y con diferentes compensaciones.

System Cost Key Advantage Key Limitation
Stationary ALOHA (DIY) $20,500-22,700 Original platform, large community Requires DIY assembly and ROS2 expertise
Mobile ALOHA (DIY) $28,000-35,000 Mobility + bimanual, co-training data Complex build, high total cost
OpenArm DK1 $12,000 Ships assembled, higher-torque servos, warranty Stationary only, smaller community
OpenArm 1 $4,500 Lowest-cost entry to robot learning Single arm only (no bimanual)
ALOHA 2 (Google DeepMind) N/A Improved hardware, better tolerances Not commercially available
UMI (Universal Manipulación Interface) $2,000-3,000 No robot needed for data collection Single-arm, camera-only (no depth/force)
RCSV DK1 Lease $2,500/mo No upfront cost, includes maintenance Monthly recurring cost
RCSV Data Services $2,500 pilot No hardware at all, expert operators Limited to RCSV's task environments

¿Por qué considerar el OpenArm DK1 sobre ALOHA?

El OpenArm DK1 ($ 12,000) fue diseñado específicamente como una alternativa compatible con ALOHA que elimina el proceso de construcción DIY.

  • Naves montadas y calibradas. No 4-8 semanas de tiempo de construcción.
  • Servos de mayor par. Los actuadores personalizados de OpenArm proporcionan un 30% más de par que los servos Dynamixel XM430 en los brazos ViperX, con una mejor gestión térmica que reduce el tiempo de inactividad relacionado con el sobrecalentamiento.
  • Formatos de datos compatibles con ALOHA. Registra el mismo espacio de acción de 14 DOF y el mismo formato de episodios HDF5 que ALOHA.
  • ** Garantia y soporte de 90 días.** Incluye piezas de repuesto y soporte técnico.
  • 44% menos costo. $12,000 vs. $20,500-22,700 para un ALOHA estacionario comparable.

Cómo ayuda el RCSV a los proyectos ALOHA

Ya sea que esté construyendo un ALOHA desde cero, buscando una alternativa, o simplemente necesite datos bimanual, RCSV ofrece múltiples caminos para obtener resultados.

Hardware prefabricado

Los barcos [OpenArm DK1] (T18) ($12,000) están completamente ensamblados y calibrados, listos para la recopilación de datos en el primer día. Para los proyectos de un solo brazo, el [OpenArm 1] (T19) ($4,500) proporciona un punto de entrada aún más bajo. Ambos sistemas se integran con LeRobot y producen formatos de datos compatibles con ALOHA.

Recopilación de datos de los operadores expertos

El servicio de recogida de datos de RCSV (T20) proporciona conjuntos de datos de demostración bimanual recogidos profesionalmente. Nuestros operadores están capacitados en la teleoperación de estilo ALOHA con una técnica consistente que produce datos de capacitación de alta calidad.

  • Proyecto piloto: $2,500 -- 50-100 demostraciones para una sola tarea, entregadas en 2 semanas
  • ** Campaña completa:** $8,000 -- 200-500 demostraciones en múltiples tareas, con anotación y validación de calidad

Alquiler de robots

El programa de arrendamiento de robots de RCSV ofrece sistemas bimanual completamente ensamblados y calibrados en términos mensuales de arrendamiento. Alquilar un DK1 por $2,500 / mes (incluye mantenimiento y soporte) y recopilar datos en su propio entorno. Esto elimina la inversión de capital inicial y le permite comenzar inmediatamente.

Acceso al laboratorio

RCSV opera laboratorios de robótica equipados en San Francisco, CA y Allston, MA. Si necesita acceso ocasional a hardware de clase ALOHA para la recopilación de datos, prototipos o evaluación, [contáctenos] T22) sobre los arreglos de acceso al laboratorio.

Preguntas frecuentes

**¿Cuál es la diferencia entre ALOHA y ACT? **

ALOHA es la plataforma de hardware (armas de robot, cámaras, configuración de teleoperación). ACT (Action Chunking with Transformers) es el algoritmo de software que entrena políticas de manipulación de los datos de ALOHA. Fueron introducidos en el mismo documento pero son independientes: se pueden recopilar datos de ALOHA y entrenarlo con Política de difusión en lugar de ACT, o se puede entrenar ACT en datos de hardware no de ALOHA. Ver nuestra guía de ACT (T23) para más detalles sobre el algoritmo.

** ¿Puedo usar ALOHA para tareas más allá de la manipulación? **

ALOHA está diseñado específicamente para la manipulación bimanual. Sus brazos tienen una carga útil limitada (750 g en extensión completa) y un alcance limitado (300 mm), por lo que no es adecuado para el levantamiento pesado, montaje de alta precisión (tolerancias más estrictas que 2 mm) o tareas que requieren control de fuerza más allá de la capacidad de detección actual del servo. Para una manipulación hábil que requiera un control individual del dedo, véase Manos de Orca o guantes táctiles de Paxini Gen3.

¿Cuántas demostraciones necesito?

Para una tarea simple bimanual con variabilidad limitada (posiciones fijas de objetos, estrategia de enfoque único): 50 demostraciones pueden lograr una tasa de éxito del 60-80% con ACT. Para tareas con alta variabilidad (posiciones aleatorias de objetos, múltiples enfoques válidos): se necesitan 200-500 demostraciones para un rendimiento robusto. Para tareas de múltiples pasos (5+ subtareas secuenciales): 300-1,000 demostraciones. Nuestro [análisis de costes por demostración] ((T26) proporciona orientaciones detalladas.

¿ALOHA sigue siendo relevante en 2026?

Sí. A pesar de las plataformas más nuevas, ALOHA sigue siendo el sistema de manipulación bimanual más ampliamente replicado y mejor documentado. La gran comunidad significa más conjuntos de datos compartidos, modelos pre-entrenados y recursos de resolución de problemas que cualquier alternativa. El formato de datos ALOHA (14-DOF posiciones conjuntas + imágenes de múltiples visualizaciones) se ha convertido en un estándar de facto para el aprendizaje bimanual, y la mayoría de los nuevos algoritmos se comparan con las tareas ALOHA.

¿Puedo añadir a ALOHA manos hábiles?

Sí, aunque requiere una modificación significativa. El agarre ALOHA estándar es una simple mandíbula paralela de 1 DOF. Su sustitución por una mano con múltiples dedos (como la [Mano de Orca] ((T27), 17-DOF) aumenta dramáticamente la dimensión del espacio de acción y la complejidad de la teleoperación. También necesitas una interfaz de teleoperatoria diferente - el enfoque estándar líder-seguidor no se extiende naturalmente a manos hábiles. La teleoperatoria basada en guantes (utilizando [guantes táctiles Paxini Gen3]T28)) es la mejor práctica actual para el control de manos hábiles.

**¿Dónde puedo encontrar conjuntos de datos ALOHA para probar mis algoritmos? **

Hay varios conjuntos de datos públicos de ALOHA disponibles en HuggingFace Hub: los conjuntos de datos de papel ACT originales (inserción de ranuras, recuperación de tenedor, elaboración de café), conjuntos de datos ALOHA móviles (busse de mesa, apertura de puerta) y conjuntos de datos contribuidos por la comunidad para varias tareas. RCSV también mantiene conjuntos de datos curados en nuestra [página de conjuntos de datos]

Lectura relacionada

Desglose de costos de ALOHA móvil · Guía de configuración de ALOHA móvil · Transformadores de acción de desglose (ACT) · Política de ACT contra difusión · LeRobot Comenzando · Guía de aprendizaje por imitación · Servicios de datos · Leasing de robots

Obtenga datos bimanual compatibles con ALOHA sin el edificio

RCSV ofrece hardware preconstruido bimanual a partir de $ 12,000, recopilación de datos profesional a partir de $ 2,500 y arrendamiento de sistema a partir de $ 2,500 / mes.

OpenArm DK1 ($12K) Servicios de datos ($2.5K)