Volver a Blog

ALOHA Robot: Qué es, cómo funciona y cómo empezar

Guía robótica ALOHA: plataforma de teleoperatoria bimanual de Stanford con doble ViperX brazos. BOM completo, configuración de entrenamiento ACT, y alternativas rentables de RCSV a partir de $4,500.

ALOHA es la plataforma de teleoperatoria bimanual de la Universidad de Stanford que demostró, por primera vez, que un robot podía aprender tareas de manipulación de dos manos hábiles como abrir una bolsa de chips, atar un cable o cocinar a partir de un pequeño número de demostraciones humanas. Esta guía explica qué es ALOHA, cómo funciona y cómo comenzar a usarlo.

La historia de la procedencia de Stanford

ALOHA Un sistema de hardware de código abierto de bajo costo para la teleoperación bimanual fue desarrollado en el Laboratorio de Manipulación Móvil de Stanford y publicado en el artículo "Aprender Manipulación bimanual de granos finas con hardware de bajo costo" por Tony Z. Zhao et al. en 2023. La tesis central fue provocativa: no se necesita hardware robótico caro y propietario para realizar una manipulación dexterosa impresionante. ALOHA utilizó cuatro brazos robóticos ViperX 300 y WidowX 250 (dos por lado, uno como líder para la teleoperatoria y uno como seguidor) que costaron menos de $20,000 en total, combinados con el algoritmo ACT, para realizar tareas que anteriormente habían requerido sistemas diseñados a medida que costaron muchas veces más.

El documento demostró 10 tareas bimanual, incluyendo desenvuelvar un pedazo de dulces, insertar una batería en una ranura y hacer un hilo de cuerda a través de un agujero, todo con tasas de éxito superiores al 80% utilizando 50 demostraciones. Estos resultados sorprendieron a la comunidad robótica no porque las tareas fueran novedosas, sino debido al costo y la eficiencia de los datos. ALOHA y ACT establecieron juntos un nuevo punto de referencia para la investigación de manipulación hábil accesible y desencadenaron una ola de trabajo de seguimiento que continúa hasta el día de hoy.

El diseño de hardware de ALOHA y todo el software son totalmente de código abierto. La lista de materiales, instrucciones de montaje y código de capacitación de ACT están disponibles públicamente en GitHub. Esta apertura ha hecho de ALOHA la plataforma de investigación bimanual estándar de facto, con docenas de grupos de investigación en todo el mundo que ejecutan variantes del diseño original. RCSV apoya las plataformas de la clase ALOHA a través de nuestros servicios de datos y programa de arrendamiento de hardware.

Especificación de hardware completa

Comprender la configuración exacta del hardware importa porque pequeñas desviaciones un modelo de brazo diferente, una cámara desalineada, un servo de menor par pueden producir conjuntos de datos que son incompatibles con la implementación de ACT de referencia.

Armas: ViperX 300 6DOF (seguidor) y WidowX 250 6DOF (líder)

Spec ViperX 300 (Follower) WidowX 250 (Leader)
DOF 6 + gripper 6 + gripper
Alcance 750mm 625mm
Carga Útil 750g (at full extension) 250g (at full extension)
Repetibilidad ~1mm ~2mm
Servos DYNAMIXEL XM540 + XM430 DYNAMIXEL XM430 + XL430
Communication USB via U2D2 adapter, 1Mbps USB via U2D2 adapter, 1Mbps
Control rate 50Hz (20ms loop) 50Hz (reads only)
Weight 3.6kg 2.1kg
Price (per arm) ~$5,500 ~$3,200

Sistema de cámara

El papel original utilizó 3 cámaras web Logitech C922 (2 montadas en el muñeco + 1 sobrecarga) grabando a una resolución de 480x640, 50 fps. ALOHA 2 se actualizó a cámaras Intel RealSense D405 para mejorar la calidad de imagen y la profundidad opcional. Las estaciones ALOHA de RCSV utilizan cámaras RealSense D435i con sincronización de hardware para un tiempo de cámara múltiple consistente.

Desglose de los costes de la asamblea completa

Component Qty Unit Cost Subtotal
ViperX 300 6DOF arms (follower) 2 $5,500 $11,000
WidowX 250 6DOF arms (leader) 2 $3,200 $6,400
Cameras (RealSense D435i or D405) 3-4 $300 $900-1,200
U2D2 USB adapters 4 $30 $120
Power supplies (12V) 4 $35 $140
Aluminum extrusion frame + brackets 1 set $500 $500
Camera mounts, cable management, misc 1 set $200 $200
Workstation PC (RTX 4090, 32GB RAM) 1 $2,500 $2,500
Total (DIY build) ~$21,800-22,100
Total (with Mobile ALOHA base) + AgileX Tracer ($10,000) ~$32,000

El tiempo de montaje para un constructor experimentado es de aproximadamente 20-30 horas. Para una primera construcción, presupuesta 40-60 horas incluyendo el desembolso de problemas de comunicación Dynamixel, calibración de la cámara y configuración del software. Los puntos de falla más comunes de ensamblaje son: cableado de cadena de margarita Dynamixel (asignamiento incorrecto de bus ID hace que los segmentos de brazos respondan fuera de orden), enrutamiento de cable de cámara a través de la muñeca (cables que son demasiado apretados restringir la rotación de la muñeca), y rigidez del marco (boltos de extrusión subtilados crean vibración que afecta la calidad de imagen de la cámara).

Configuración del software: desde el clon hasta la primera demostración

La pila de software ALOHA tiene dos componentes: el bucle de control de teleoperación (líder de lectura, seguidor de comando, datos de grabación) y el tubo de entrenamiento ACT.

# Clone e instale el repositorio ACT git clone T27 cd act conda crear -n aloha python=3.8.16 -y conda activar aloha pip instalar -r requirements.txt # Instalar SDK Interbotix para control de brazos # Seguir: T28 sudo apt instalar ros-humble-interbotix-xsarm-control # Configurar dispositivos USB de brazo # Cada brazo necesita un mapa de puerto USB único en /etc/udev/rules.d/ # Líder: /dev/ttyDXL_transleader_leader _left # Líder derecho: /dev/ttyDXL_leader_right # Seguidor izquierdo: /ttyDXL_testy_left # Seguidor /dev/dxl\Lep_follower \leap_script \leap_script \leap_script \leap_script \leap_script \leap_script \leap_script \leap_script \leap_script \leap_script \leap_script \leap_script \le_script \leap_script \le_script \le_script_script \le_script_script_script_script_script_script_script_script_script_script_script_script_script_script_script_script_script_script_script_script_script_script_script_script_script_script

El script de grabación produce archivos HDF5 con la siguiente estructura por episodio: T0 (overhead), T1, T2, T3 (14-dim joint positions: 7 por brazo), T4 (14-dim joint position targets), y T5. Cada episodio es un archivo HDF5 autónomo, típicamente de 20-50 MB dependiendo de la resolución de la cámara y la longitud del episodio.

ROS2 Integración

Mientras que el código ALOHA original utiliza el Interbotix Python SDK directamente (no ROS), muchos equipos se integran con ROS2 para la compatibilidad con MoveIt2, controladores de cámara y visualización.

  • Establezca la velocidad de baud de Dynamixel a 1Mbps para los brazos del líder y del seguidor para mantener la velocidad de control de 50Hz
  • Utilice un centro USB dedicado (no un centro con cadena de margaritas) para evitar la disputa de buses entre 4 conexiones simultáneas de serie USB
  • Configurar los controladores de cámara para publicar imágenes comprimidas para reducir el ancho de banda RGB crudo de 640x480 a 30 fps por cámara es de 27.6 MB/s por cámara, 110 MB/s para 4 cámaras
  • Utilice filtros de mensajes ROS2 para la sincronización de tiempo entre los temas de la cámara

Arquitectura de hardware: configuración bimanual de líder y seguidor

El sistema ALOHA consiste en dos pares cinemáticos, uno para cada brazo. Cada par tiene un brazo "líder" un brazo ligero y retro-conducible que el operador sostiene y se mueve con sus manos y un brazo "seguidor" que refleja las posiciones conjuntas del líder en tiempo real. El brazo seguidor lleva el manipulador real (agarrador, herramienta o efecto final) e interactuará con el mundo físico. El brazo líder no tiene requisitos de carga útil para el efecto final porque solo necesita ser conducible hacia atrás y proporcionar retroalimentación del par al operador.

La configuración bimanual dos pares completos de líderes y seguidores es lo que hace que ALOHA sea única en habilidades para tareas hábiles. Las manos humanas son bimanual por naturaleza: una mano sostiene el objeto mientras que la otra lo manipula, o ambas manos cooperan para completar una tarea que requiere dos puntos de contacto simultáneos. Los robots de un solo brazo sólo pueden aproximarse a estas tareas con fijos o secuencias complejas; los robots bimanual pueden manejarlas directamente. El factor de forma ALOHA, con ambos brazos montados en un accesorio compartido de la mesa, está optimizado para las tareas de manipulación de la mesa donde el operador se sienta frente al sistema.

La configuración de la cámara en el papel ALOHA original utilizaba tres cámaras: una por encima (vista de pájaro del espacio de trabajo completo), una en la muñeca izquierda y otra en la muñeca derecha. Esta configuración de múltiples visualizaciones es crítica: las cámaras de muñeca proporcionan vistas de cerca de los eventos de captura y contacto, mientras que la cámara aérea proporciona un contexto global para la coordinación de dos manos.

Configuración alternativa de dos manuales: Kit RCSV DK1

ALOHA no es la única opción para la investigación bimanual de teleoperaciones. El kit bimanual DK1 de RCSV ofrece varias ventajas para los equipos que priorizan el rendimiento de recopilación de datos sobre la compatibilidad exacta de ALOHA:

Feature ALOHA (DIY Build) RCSV DK1 Kit
Arms ViperX 300 + WidowX 250 OpenArm 1 leader-follower pairs
Total cost ~$22,000 + assembly $9,000 pre-assembled
Assembly time 20-60 hours 2 hours (unbox + calibrate)
Carga Útil (per arm) 750g 500g
Data format HDF5 (custom schema) HDF5 + LeRobot export
ACT compatibility Native Via format conversion
Community size Largest (100+ labs) Growing (RCSV ecosystem)

El DK1 es la mejor opción para los equipos que necesitan comenzar a recopilar datos de inmediato y planean entrenarse con políticas de difusión o VLA (que son arquitectónico-agnóstico con respecto al robot específico). ALOHA es la mejor opción para los equipos que necesitan una compatibilidad exacta con los resultados publicados de ACT o quieren contribuir al ecosistema de código abierto ALOHA. Consulte nuestro [catálogo de hardware] ((T10) para más detalles de DK1.

Casos de uso de ALOHA: qué funciona y qué no

Tareas en las que ALOHA es excelente

  • ** Manipulación bimanual de mesa:** Abertura de contenedores, plegado, transferencia entre manos, montaje de dos manos.
  • ** Investigación en preparación de alimentos:** Agitar, recoger, verter, cortar materiales blandos.
  • ** Manipulación de cables y objetos deformables:** Cables, envoltura, unión. Las cámaras de muñeca proporcionan la visión de cerca necesaria para las tareas de contacto deformables.
  • Recolección de datos a escala: El diseño de código abierto significa que se pueden construir varias estaciones idénticas.

Tareas donde ALOHA lucha

  • ** Manipulación de objetos pesados:** El límite de carga útil de 750 g (en extensión completa) excluye muchos objetos industriales.
  • Inserción de precisión por debajo de 1 mm: La repetibilidad de ~1 mm de los servos ViperX limita la precisión. Para las tareas submilimétricas, se necesita una retroalimentación de fuerza (no incluida en la base ALOHA) o una plataforma de brazo de mayor precisión.
  • Tascas de gran tamaño en el espacio de trabajo: El alcance de 750 mm limita el espacio de trabajo a un área de mesa de aproximadamente 1 m x 0,5 m. Las tareas que requieren movimiento a través de un mostrador de cocina o entre estanterías requieren ALOHA móvil o una plataforma diferente.
  • ** Manipulación de alta velocidad:** El circuito de control de 50 Hz limita la velocidad reactiva. Las tareas que requieren respuestas rápidas y reflexivas a perturbaciones inesperadas (captura de un objeto lanzado, transferencia dinámica) están más allá de la capacidad actual de ALOHA.

El algoritmo detrás de ALOHA

ACT (Action Chunking with Transformers) fue desarrollado junto con ALOHA y es el algoritmo de aprendizaje primario para la plataforma. ACT es una política de aprendizaje de imitación basada en transformadores que predice una pieza de posiciones conjuntas futuras típicamente 100 pasos de tiempo a 50Hz, cubriendo 2 segundos de movimiento en lugar de una sola acción siguiente. Esta arquitectura de acción de gran tamaño reduce sustancialmente el problema de error de composición de la clonación comportamental ingenua, donde pequeños errores de predicción en cada paso de tiempo se acumulan en grandes desviaciones de trayectoria en el transcurso de una tarea.

La arquitectura de políticas de ACT utiliza un codificador CVAE (Conditional Variational Codificador Automático) durante el entrenamiento para capturar el estilo latente de cada demostración esencialmente, una representación comprimida de "cómo" el humano completó la tarea, distinta de "qué" fue el resultado de la tarea. Esto permite a la política modelar la variación natural en las demostraciones humanas sin artefactos promediantes de modo. En el momento de la inferencia, solo el decodificador CVAE se ejecuta, condicionado a la observación actual y a un vector latente muestrado, para generar la pieza de acción.

El entrenamiento ACT en un conjunto de datos ALOHA con 50 demostraciones por tarea toma 24 horas en una sola GPU RTX 3090. El código de entrenamiento, publicado con el papel original, es fácil de ejecutar con hiperparámetros documentados para tareas ALOHA estándar. Para las tareas personalizadas, el hiperparámetro más impactante para sintonizar es el tamaño de la pieza (kl_peso en la configuración) piezas más grandes mejoran la consistencia temporal a costa de la reactividad a perturbaciones inesperadas.

ALOHA móvil: quitar ALOHA de la mesa

Mobile ALOHA, publicado por el mismo grupo de Stanford en 2024, extendió el concepto de ALOHA a una base móvil. La configuración del brazo bimanual se montó en una base móvil AgileX Tracer, permitiendo al sistema navegar a diferentes lugares dentro de un espacio acercándose a un mostrador de cocina, moviéndose a una mesa de comedor, navegando por un pasillo mientras se conservaban los brazos ALOHA para la manipulación. Mobile ALOHA demostró tareas como cocinar camarones en una estufa, cargar una lavadora de platos y entregar un paquete tareas que requieren tanto movimiento como manipulación hábil.

Mobile ALOHA introdujo el concepto de teleoperación de todo el cuerpo: el operador controla tanto la base móvil como los dos brazos simultáneamente, ya sea a través de interfaces de control separadas o a través de una interfaz unificada que mapea los movimientos del cuerpo del operador a la configuración del cuerpo completo del robot. La recopilación de datos para Mobile ALOHA es significativamente más compleja que para tabletop ALOHA porque la política debe aprender a coordinar la navegación y la manipulación, lo que requiere demostraciones que cubran la variación espacial en el entorno, así como la variación de objetos.

Mobile ALOHA también introdujo una capacitación conjunta: la capacitación de la política de Mobile ALOHA en demostraciones de manipulación móvil y demostraciones de manipulación estáticas de ALOHA. RCSV ofrece conjuntos de datos compatibles con Mobile ALOHA y puede recopilar demostraciones de manipulación móvil en nuestra instalación de San Francisco. Contact us para discutir sus requisitos de datos de Mobile ALOHA.

Diferencias entre ALOHA, ALOHA 2 y derivados comerciales

ALOHA 2, publicado a finales de 2024, mejoró en el original en varias dimensiones: brazos de mayor calidad con mejor repetibilidad, un mejor sistema de montaje de cámara y un diseño revisado de muñeca que reduce la complejidad de enrutamiento de cables. El sistema eléctrico también se actualizó para utilizar una placa de distribución de energía dedicada en lugar de cables de energía con cadena de diamante, mejorando la confiabilidad durante sesiones de recopilación de datos largas. ALOHA 2 mantiene la completa compatibilidad del software con los conjuntos de datos originales recogidos en una puede entrenar políticas evaluadas en la otra, sujeto a las advertencias habituales sobre la variación de hardware.

Varios proveedores comerciales ahora venden plataformas compatibles con ALOHA sistemas preensamblados y probados que siguen las especificaciones mecánicas y de software de ALOHA sin requerir que el constructor obtenga componentes y ensamble los brazos por sí mismo. Estos sistemas comerciales de ALOHA cuestan más que la factura de materiales de bricolaje, pero reducen sustancialmente el tiempo de instalación y el riesgo de errores de montaje. El catálogo de hardware de RCSV incluye configuraciones compatibles con ALOHA; ver la tienda para las opciones y precios actuales.

Comienza con ALOHA a través de RCSV

RCSV apoya la investigación basada en ALOHA en cada etapa. Para los equipos que recién comienzan, ofrecemos alquiler de la plataforma ALOHA a través de nuestro [programa de alquiler de robots]T14) acceso a una configuración bimanual completa por una tarifa mensual fija sin el compromiso de capital de la compra de hardware. Los sistemas alquilados llegan precalibrados y listos para recoger demostraciones en el primer día.

Para la recopilación de datos, nuestro servicio administrado proporciona a los operadores ALOHA capacitados que pueden recopilar demostraciones en nuestra instalación de San Francisco, con conjuntos de datos entregados en formato RLDS/LeRobot compatibles con ACT, Política de difusión y tuberías de capacitación OpenVLA. Nuestros operadores tienen experiencia con tareas de coordinación bimanual y siguen protocolos de calidad estructurados que producen conjuntos de datos más limpios de los que generalmente logran los investigadores por primera vez. Los programas piloto comienzan a $ 2,500 para 200 demostraciones. También podemos visitar su sitio para campañas de recopilación de datos en la ubicación si su tarea lo requiere.

Para la formación y evaluación de políticas, la plataforma [RCSV]T16) proporciona tuberías de formación ACT preconfiguradas, seguimiento de experimentos y herramientas de evaluación para las políticas ALOHA. Nuestros [marcos de referencia]T17) incluyen evaluaciones de tareas específicas de ALOHA que le permiten comparar su desempeño de las políticas con las implementaciones de referencia. Ya sea que esté construyendo un programa de investigación de manipulación bimanual desde cero o tratando de impulsar el rendimiento de un sistema existente, [el equipo de RCSV]T18) puede ayudarle a planificar el enfoque correcto.

Lectura relacionada