Robot ALOHA: Sistema de Teléoperación Bimanual de código abierto de Stanford
Guía completa de robots ALOHA: lo que es, BOM completo y costo ($ 17K-$ 32K), configuración con ROS2 y ACT, entrenamiento de tareas bimanual, y alternativas rentables a partir de $ 4,500.
[← Guías]
Todo lo que necesitas saber sobre ALOHA, la plataforma que hizo que el aprendizaje bimanual de robots fuera accesible a todos los laboratorios, desde la arquitectura y el costo hasta la configuración, la capacitación y las alternativas.
¿Qué es ALOHA?
ALOHA se refiere a Un sistema de hardware de código abierto de bajo costo para la teleoperación bimanual. Fue desarrollado en la Universidad de Stanford por Tony Zhao, Vikash Kumar, Sergey Levine y Chelsea Finn, y se introdujo en el artículo de 2023 "Aprender Manipulación Bimanual de Granos Finales con Hardware de Bajo Costo" junto con ACT (Action Chunking with Transformers), el algoritmo de aprendizaje de imitación diseñado para trabajar con datos ALOHA.
Antes de ALOHA, la investigación de manipulación bimanual requería robots industriales caros (dos Pandas Franka Emika a $80,000 + o un Baxter a $ 25,000) y una amplia ingeniería personalizada. ALOHA demostró que dos brazos robóticos de grado de consumo en una configuración de líder-seguidor podrían recopilar datos de demostración bimanual de alta calidad que entrenan políticas de manipulación efectivas - a aproximadamente una décima parte del costo de los sistemas anteriores.
El sistema ha sido replicado por docenas de laboratorios en todo el mundo y ha generado varias variantes, en particular ** Mobile ALOHA** (agrega una base de ruedas para la teleoperatoria de todo el cuerpo) y ALOHA 2 (versión mejorada de Google DeepMind con mejores tolerancias de hardware).
Por qué ALOHA es importante
El significado de ALOHA no es el hardware en sí mismo, es básicamente dos brazos robóticos fuera de la plataforma atados a una mesa. Su impacto proviene de tres contribuciones:
- ** Recopilación de datos bimanual democratizada.** El diseño líder-seguidor permite a cualquier operador humano demostrar tareas bimanual sin programación. El operador sostiene los brazos del líder y realiza la tarea de manera natural; los brazos del seguidor reflejan el movimiento mientras las cámaras registran observaciones. Esto produjo los primeros conjuntos de datos de demostración bimanual a gran escala a un costo accesible a los laboratorios universitarios.
- Acción con transformadores (ACT). El algoritmo ACT, introducido en el mismo documento, predice pedazos de 100 acciones futuras a la vez en lugar de una acción a la vez. Esto reduce dramáticamente los errores compuestos que plagaron a los enfoques de aprendizaje de imitación anteriores, logrando tasas de éxito del 80-90% en tareas en las que los métodos anteriores alcanzaron el 20-40%.
- Reproducibilidad de código abierto. Cada componente - archivos CAD, BOM, controladores ROS2, scripts de grabación de datos, código de capacitación ACT y modelos pre-entrenados - está disponible al público. Esto permitió una rápida adopción e iteración en toda la comunidad robótica.
ALOHA estacionaria vs ALOHA móvil
La plataforma ALOHA existe en dos configuraciones principales.
| Feature | Stationary ALOHA | Mobile ALOHA |
|---|---|---|
| Base | Fixed table mount | AgileX Tracer wheeled base |
| Follower arms | 2x ViperX 300 S2 | 2x ViperX 300 S2 |
| Leader arms | 2x WidowX 250 S | 2x WidowX 250 S |
| Action space | 14-DOF (7 per arm) | 16-DOF (14 arm + 2 base velocity) |
| Cameras | 2 wrist + 1 overhead | 2 wrist + 1 overhead + 1 side (optional) |
| Hardware cost | $17,000-22,000 | $28,000-35,000 |
| Setup time | 2-4 weeks | 4-8 weeks |
| Best for | Tabletop bimanual tasks | Tasks requiring locomotion + manipulation |
Para la mayoría de los equipos, el ALOHA estacionario es el punto de partida adecuado. ALOHA móvil añade $10,000-15,000 en costo y complejidad de integración significativa para la capacidad de movilidad. Si sus tareas ocurren en una sola estación de trabajo - ensamblaje, embalaje, preparación de la cocina, manipulación de laboratorio - ALOHA estacionario (o una alternativa compatible con ALOHA como el [OpenArm DK1]
Para obtener una descripción detallada de los costes de la variante móvil, consulte nuestra Disminución de costes ALOHA móvil.
Arquitectura del sistema ALOHA
Comprender la arquitectura de ALOHA te ayuda a evaluar si construir una, comprar una alternativa o externalizar la recopilación de datos por completo.
Hardware: Teléoperación de seguidores y líderes
ALOHA utiliza una configuración líder-seguidor (también llamada maestro-esclavo).
- ** brazo de seguimiento (ViperX 300 S2):** El brazo robot que ejecuta tareas e interactúa con objetos. Tiene 6 DOF más un agarre (7 en total), utiliza servos de la serie Dynamixel XM / XH, y tiene una carga útil de 750g en extensión completa. Durante la teleoperatoria, refleja las posiciones articulares del brazo líder a 50 Hz.
- ** brazo de líder (WidowX 250 S):** El brazo sostenido y movido por el operador humano. Es más ligero y de menor alcance que el seguidor, lo que lo hace cómodo para manipular para sesiones de recopilación de datos extendidas. Proporciona retroalimentación de la fuerza a través de la compensación de gravedad - los servos sostienen el propio peso del brazo, por lo que el operador solo siente la inercia de sus movimientos intencionales.
El brazo líder y el brazo seguidor se conectan a través de USB a la misma computadora de bordo a través de adaptadores Dynamixel U2D2. El bucle de control lee las posiciones conjuntas del brazo líder a 50 Hz y envía comandos de posición correspondientes al brazo seguidor. La latencia total de extremo a extremo debe permanecer por debajo de 10 ms para una teleoperación transparente (el operador no debe sentir retraso entre sus movimientos y la respuesta del seguidor).
Sistema de cámara
ALOHA utiliza cámaras de profundidad Intel RealSense en tres posiciones:
- Dos cámaras de muñeca (RealSense D405): Montadas en las muñecas del brazo de seguimiento, proporcionando vistas de cerca del espacio de trabajo de manipulación.
- Una cámara aérea (RealSense D435): Montada sobre el espacio de trabajo, proporcionando una vista de arriba hacia abajo para el contexto espacial.
Las tres cámaras deben ser sincronizadas temporalmente (dentro de 10 ms) para que los datos grabados entrenen políticas efectivas. El cable de sincronización Intel Multi-Camera proporciona sincronización a nivel de hardware.
Computación de la pila
La computadora de bordo (normalmente una Intel NUC o mini-PC equivalente) realiza tres tareas simultáneamente:
- Control en tiempo real: Leer posiciones conjuntas del líder y posiciones conjuntas del seguidor a 50 Hz a través del servobus Dynamixel.
- Cacta de cámara: Grabación de marcos RGB sincronizados de tres cámaras a 30 fps.
- Registro de datos: Escribir todos los datos de los sensores (posiciones conjuntas, velocidades, marcos de cámara, sellos de tiempo) en archivos HDF5 para entrenamiento posterior.
No se necesita GPU en el robot. La capacitación de políticas se realiza fuera de línea en una estación de trabajo separada (RTX 4090 o GPU en la nube). La implementación de políticas (inferencia) puede ejecutarse en la CPU de la NUC para los modelos ACT, que requieren menos de 10 ms por pase avanzado.
Desglose de costes ALOHA estacionario
La configuración ALOHA estacionaria (sin base móvil) es significativamente más barata y más rápida de construir.
| Component | Cost | Notes |
|---|---|---|
| 2x ViperX 300 S2 follower arms | $9,600 | $4,800 each, Dynamixel XM/XH servos |
| 2x WidowX 250 S leader arms | $6,200 | $3,100 each, lighter weight for operator comfort |
| 2x Custom gripper assemblies | $400-800 | Parallel-jaw with Dynamixel XL330 |
| 3x Intel RealSense cameras | $950 | 2x D405 wrist ($300 ea) + 1x D435 overhead ($350) |
| Intel NUC 13 Pro (onboard computer) | $800-1,200 | i7, 32GB RAM, 1TB NVMe |
| U2D2 adapters, USB hub, cables | $350-500 | 4x U2D2 ($50 ea), powered USB hub, cabling |
| Mounting hardware, table clamps | $200-400 | Camera mast, arm base plates, clamps |
| Stationary ALOHA total | $18,500-19,700 | Hardware only, before labor |
| Training workstation (RTX 4090) | $2,000-3,000 | Separate desktop for offline training |
| Complete system total | $20,500-22,700 | Excluding integration labor |
Esto representa el costo mínimo para un ALOHA estacionario totalmente funcional. Agregue $ 2,000-5,000 para el montaje profesional si está subcontratando la construcción. Para la variante móvil, agregue $ 10,000-15,000 para la base AgileX, el marco de montaje, la batería adicional y la integración. Consulte nuestro [desglose detallado de costos de ALOHA móvil]
Estaca de software
La pila de software ALOHA tiene cuatro capas, cada una de código abierto y bien documentada.
1. ROS2 Humble (control en tiempo real)
ROS2 Humble en Ubuntu 22.04 proporciona la capa de comunicación.
- Paquetes Interbotix ROS2: Conductores para los brazos ViperX y WidowX. Proporcionan una suscripción conjunta de comandos de publicación y posición en 50 Hz.
- Envase de RealSense ROS2: Los nodos de conductor de cámara publican imágenes RGB y profundidad a 30 fps.
- Nodo de teleoperación: Leer las posiciones de los brazos del líder y enviar comandos de coincidencia a los brazos seguidores a 50 Hz.
# Install ROS2 Humble and ALOHA dependencies
sudo apt install ros-humble-desktop python3-colcon-common-extensions
# Install Interbotix arm drivers
curl 'https://raw.githubusercontent.com/Interbotix/interbotix_ros_manipulators/main/interbotix_ros_xsarms/install/amd64/xsarm_amd64_install.sh' > xsarm_install.sh
chmod +x xsarm_install.sh && ./xsarm_install.sh -d humble
# Install RealSense drivers
sudo apt install ros-humble-librealsense2* ros-humble-realsense2-camera
2. Repositorio ALOHA (Teleoperación y grabación)
El repositorio oficial de ALOHA GitHub proporciona scripts para la teleoperación líder-seguidor y la grabación de datos sincronizada. Se ocupa de la tarea crítica de alinear los datos de estado conjunto (50 Hz) con los marcos de la cámara (30 fps) en episodios HDF5 con sello de tiempo. Cada episodio contiene:
T2 : forma (T, 14) -- posiciones conjuntas comandadas (7 por brazo) T3 : forma (T, 14) -- posiciones de las articulaciones medidas T4 : forma (T, 480, 640, 3) -- cámara aérea T5 : forma (T, 480, 640, 3) T6 : forma (T, 480, 640, 3)
3. Código de formación del ACT (aprendizaje de políticas fuera de línea)
ACT (Action Chunking with Transformers) es el algoritmo de entrenamiento predeterminado para los datos ALOHA.
- Encodificador: Procesan las observaciones actuales (posiciones conjuntas + imágenes de cámara) a través de un codificador de imágenes ResNet-18 y un MLP de estado conjunto.
- ** Decodificador:** Un decodificador de transformador con un CVAE (Conditional Variational Codificador Automático) que predice una pieza de 100 acciones futuras a la vez.
- ** Ensamble temporal:** Durante el despliegue, los trozos de acción superpuestos se promedian con ponderación exponencial, suavizando las transiciones entre predicciones sucesivas.
# Train ACT policy on ALOHA data using LeRobot
python lerobot/scripts/train.py \
policy=act \
dataset_repo_id=your-username/aloha-task \
env=aloha \
training.num_epochs=2000 \
training.batch_size=8 \
policy.chunk_size=100 \
policy.kl_weight=10
4. LeRobot (Layer de Integración Moderna)
[LeRobot]
Guía de configuración
La construcción y configuración de un sistema ALOHA implica cinco fases. Para obtener instrucciones detalladas paso a paso, consulte nuestra Guía de configuración de ALOHA móvil (que cubre las configuraciones estacionarias y móviles).
Fase 1: Ensamblaje de hardware (3-5 días)
Montar los brazos de seguidores a la mesa o el marco, instalar los brazos de líder a la altura del operador, montar agarradores, montar cámaras y conectar toda la electrónica. Detalles críticos: las placas de base del brazo deben ser co-planares a menos de 1 mm; la montaje de la cámara debe ser rígida (cualquier flexión produce datos inconsistentes). Torque todos los tornillos a la especificación y aplicar un cordón a las articulaciones propensas a las vibraciones.
Fase 2: Configuración y calibración de ROS2 (3-7 días)
Instale Ubuntu 22.04, ROS2 Humble, controladores Interbotix y controladores RealSense. Configure los parámetros de servo de Dynamixel: configure la velocidad de baud a 1M, calibre las posiciones cero para cada unión, configure ganancias PID y configure la compensación de gravedad en los brazos del líder. Verifique el orden de enumeración del dispositivo USB (esta es una fuente común de errores cuando los dispositivos se reasignan después del reinicio).
Fase 3: Primera prueba de teleoperatoria (1-2 días)
Ejecutar el nodo de teleoperación y verificar que ambos pares de brazos rastrean correctamente. Compruebe: latencia líder a seguidor (debe ser inferior a 10 ms), precisión de seguimiento (el seguidor debe coincidir con la posición del líder a menos de 2 grados), sincronización de agarre (estados abiertos / cerrados coinciden) y alimentación de cámara (las tres cámaras producen marcos limpios a 30 fps).
Fase 4: Grabación de las demostraciones (en curso)
Definir su tarea, configurar el script de grabación y comenzar a recopilar demostraciones. Comience con una simple tarea de validación (pick and place) para verificar la línea completa antes de invertir tiempo en tareas complejas. Recoge 50 demostraciones para la tarea de validación, entrene una política y evalúe. Objetivo: 60% + tasa de éxito. Si es inferior al 40%, deshacerse del hardware / calibración antes de recopilar más datos.
Fase 5: Política de formación ACT (4-8 horas por carrera de formación)
Empuje su conjunto de datos a HuggingFace Hub (o tren localmente), configure los hiperparámetros ACT y entren. Hiperparámetros clave: chunk_size=100, kl_weight=10, lot_size=8, num_epochs=2000. Observe pérdida de validación - el entrenamiento se realiza cuando se producen plateaos de pérdida durante más de 200 épocas. Implemente la política entrenada de nuevo en el robot para la evaluación.
Indicadores de rendimiento
Estas tasas de éxito son del documento original de ACT (Zhao et al., 2023) y las publicaciones posteriores de ALOHA. Sus resultados variarán en función de la calidad de calibración del hardware, el número de demostraciones y la habilidad del operador.
| Task | Success Rate | Demos Used | Notes |
|---|---|---|---|
| Slot insertion (bimanual) | 91% | 50 | One arm holds socket, other inserts battery |
| Fork retrieval from pot | 82% | 50 | Requires precise grasp in confined space |
| Coffee making (multi-step) | 62% | 50 | Long-horizon, 5+ sequential sub-tasks |
| Table bussing (mobile) | 85% | 50 mobile + 370 static | Mobile ALOHA with co-training |
| Door opening (mobile) | 76% | 50 mobile + 370 static | Whole-body coordination required |
| Object handover to human (mobile) | 68% | 50 mobile + 370 static | Requires detecting human presence and timing |
Creo clave de los puntos de referencia: La co-entrenamiento es muy importante para las tareas móviles. Las tareas móviles anteriores utilizaron solo 50 demostraciones móviles, pero fueron co-entrenadas con 370 demostraciones bimanual estáticas. Esto significa que puede recopilar la mayor parte de sus datos en una configuración estacionaria más barata y agregar una pequeña cantidad de datos móviles para obtener políticas móviles.
ALOHA Alternativas de comparación
Varios sistemas ofrecen una capacidad de teleoperación bimanual similar a la de ALOHA a diferentes precios y con diferentes compensaciones.
| System | Cost | Key Advantage | Key Limitation |
|---|---|---|---|
| Stationary ALOHA (DIY) | $20,500-22,700 | Original platform, large community | Requires DIY assembly and ROS2 expertise |
| Mobile ALOHA (DIY) | $28,000-35,000 | Mobility + bimanual, co-training data | Complex build, high total cost |
| OpenArm DK1 | $12,000 | Ships assembled, higher-torque servos, warranty | Stationary only, smaller community |
| OpenArm 1 | $4,500 | Lowest-cost entry to robot learning | Single arm only (no bimanual) |
| ALOHA 2 (Google DeepMind) | N/A | Improved hardware, better tolerances | Not commercially available |
| UMI (Universal Manipulación Interface) | $2,000-3,000 | No robot needed for data collection | Single-arm, camera-only (no depth/force) |
| RCSV DK1 Lease | $2,500/mo | No upfront cost, includes maintenance | Monthly recurring cost |
| RCSV Data Services | $2,500 pilot | No hardware at all, expert operators | Limited to RCSV's task environments |
¿Por qué considerar el OpenArm DK1 sobre ALOHA?
El OpenArm DK1 ($ 12,000) fue diseñado específicamente como una alternativa compatible con ALOHA que elimina el proceso de construcción DIY.
- Naves montadas y calibradas. No 4-8 semanas de tiempo de construcción.
- Servos de mayor par. Los actuadores personalizados de OpenArm proporcionan un 30% más de par que los servos Dynamixel XM430 en los brazos ViperX, con una mejor gestión térmica que reduce el tiempo de inactividad relacionado con el sobrecalentamiento.
- Formatos de datos compatibles con ALOHA. Registra el mismo espacio de acción de 14 DOF y el mismo formato de episodios HDF5 que ALOHA.
- ** Garantia y soporte de 90 días.** Incluye piezas de repuesto y soporte técnico.
- 44% menos costo. $12,000 vs. $20,500-22,700 para un ALOHA estacionario comparable.
Cómo ayuda el RCSV a los proyectos ALOHA
Ya sea que esté construyendo un ALOHA desde cero, buscando una alternativa, o simplemente necesite datos bimanual, RCSV ofrece múltiples caminos para obtener resultados.
Hardware prefabricado
Los barcos [OpenArm DK1] (T18
Recopilación de datos de los operadores expertos
El servicio de recogida de datos de RCSV (T20) proporciona conjuntos de datos de demostración bimanual recogidos profesionalmente. Nuestros operadores están capacitados en la teleoperación de estilo ALOHA con una técnica consistente que produce datos de capacitación de alta calidad.
- Proyecto piloto: $2,500 -- 50-100 demostraciones para una sola tarea, entregadas en 2 semanas
- ** Campaña completa:** $8,000 -- 200-500 demostraciones en múltiples tareas, con anotación y validación de calidad
Alquiler de robots
El programa de arrendamiento de robots de RCSV ofrece sistemas bimanual completamente ensamblados y calibrados en términos mensuales de arrendamiento. Alquilar un DK1 por $2,500 / mes (incluye mantenimiento y soporte) y recopilar datos en su propio entorno. Esto elimina la inversión de capital inicial y le permite comenzar inmediatamente.
Acceso al laboratorio
RCSV opera laboratorios de robótica equipados en San Francisco, CA y Allston, MA. Si necesita acceso ocasional a hardware de clase ALOHA para la recopilación de datos, prototipos o evaluación, [contáctenos]
Preguntas frecuentes
**¿Cuál es la diferencia entre ALOHA y ACT? **
ALOHA es la plataforma de hardware (armas de robot, cámaras, configuración de teleoperación). ACT (Action Chunking with Transformers) es el algoritmo de software que entrena políticas de manipulación de los datos de ALOHA. Fueron introducidos en el mismo documento pero son independientes: se pueden recopilar datos de ALOHA y entrenarlo con Política de difusión en lugar de ACT, o se puede entrenar ACT en datos de hardware no de ALOHA. Ver nuestra guía de ACT (T23) para más detalles sobre el algoritmo.
** ¿Puedo usar ALOHA para tareas más allá de la manipulación? **
ALOHA está diseñado específicamente para la manipulación bimanual. Sus brazos tienen una carga útil limitada (750 g en extensión completa) y un alcance limitado (300 mm), por lo que no es adecuado para el levantamiento pesado, montaje de alta precisión (tolerancias más estrictas que 2 mm) o tareas que requieren control de fuerza más allá de la capacidad de detección actual del servo. Para una manipulación hábil que requiera un control individual del dedo, véase Manos de Orca o guantes táctiles de Paxini Gen3.
¿Cuántas demostraciones necesito?
Para una tarea simple bimanual con variabilidad limitada (posiciones fijas de objetos, estrategia de enfoque único): 50 demostraciones pueden lograr una tasa de éxito del 60-80% con ACT. Para tareas con alta variabilidad (posiciones aleatorias de objetos, múltiples enfoques válidos): se necesitan 200-500 demostraciones para un rendimiento robusto. Para tareas de múltiples pasos (5+ subtareas secuenciales): 300-1,000 demostraciones. Nuestro [análisis de costes por demostración] ((
¿ALOHA sigue siendo relevante en 2026?
Sí. A pesar de las plataformas más nuevas, ALOHA sigue siendo el sistema de manipulación bimanual más ampliamente replicado y mejor documentado. La gran comunidad significa más conjuntos de datos compartidos, modelos pre-entrenados y recursos de resolución de problemas que cualquier alternativa. El formato de datos ALOHA (14-DOF posiciones conjuntas + imágenes de múltiples visualizaciones) se ha convertido en un estándar de facto para el aprendizaje bimanual, y la mayoría de los nuevos algoritmos se comparan con las tareas ALOHA.
¿Puedo añadir a ALOHA manos hábiles?
Sí, aunque requiere una modificación significativa. El agarre ALOHA estándar es una simple mandíbula paralela de 1 DOF. Su sustitución por una mano con múltiples dedos (como la [Mano de Orca] ((
**¿Dónde puedo encontrar conjuntos de datos ALOHA para probar mis algoritmos? **
Hay varios conjuntos de datos públicos de ALOHA disponibles en HuggingFace Hub: los conjuntos de datos de papel ACT originales (inserción de ranuras, recuperación de tenedor, elaboración de café), conjuntos de datos ALOHA móviles (busse de mesa, apertura de puerta) y conjuntos de datos contribuidos por la comunidad para varias tareas. RCSV también mantiene conjuntos de datos curados en nuestra [página de conjuntos de datos]
Lectura relacionada
Desglose de costos de ALOHA móvil · Guía de configuración de ALOHA móvil · Transformadores de acción de desglose (ACT) · Política de ACT contra difusión · LeRobot Comenzando · Guía de aprendizaje por imitación · Servicios de datos · Leasing de robots
Obtenga datos bimanual compatibles con ALOHA sin el edificio
RCSV ofrece hardware preconstruido bimanual a partir de $ 12,000, recopilación de datos profesional a partir de $ 2,500 y arrendamiento de sistema a partir de $ 2,500 / mes.







