ALOHA: Datos de teleoperatorio bimanual de bajo coste
ALOHA conjuntos de datos de teleoperación bimanual: 50+ demostraciones por tarea de granos finos, referencia abierta de hardware.
La plataforma de teleoperación bimanual de hardware abierto y el conjunto de datos de aprendizaje de imitación canónica detrás de Fragmentación de acciones, Mobile ALOHA y RT-ALOHA.
TL;DR
| Metric | Value |
|---|---|
| Task count | ~10 canonical fine-manipulation tasks (plus dozens of LeRobot re-collections) |
| Robots | 2 ViperX-300 follower arms + 2 WidowX leader arms (6-DoF each) |
| Modalities | 14-DoF joint positions, 2x gripper widths, 4x RGB cameras at 50 Hz |
| License | MIT |
| Size | ~50 demos per task, ~5-15 GB per task package |
| Hardware cost | ~$20K to build a full ALOHA cell |
¿Qué es ALOHA?
ALOHA (Un sistema de hardware de código abierto de bajo costo para la teleoperación bimanual) fue introducido por Tony Zhao y colaboradores en Stanford como el equipo y el conjunto de datos para el papel Fragmentación de acciones. Su innovación fue simple pero decisiva para la comunidad de aprendizaje de imitación: al emparejar dos brazos seguidores de 6-DoF ViperX-300 con dos brazos líderes de WidowX, ALOHA permitió a un solo operador humano realizar una manipulación fina bimanual a 50 Hz con postura natural. Esa elección de diseño desbloqueó una nueva clase de tareas
Los paquetes de datos liberados generalmente contienen 50 demostraciones por tarea con estados conjuntos sincronizados, anchos de agarre y cuatro flujos de cámara RGB (superficial, izquierda, extranjera y externa). El diseño HDF5 se ha convertido en un esquema de facto para el aprendizaje de imitación bimanual, y el proyecto LeRobot mantiene espejos Parquet que se conectan directamente al cargador de datos de transmisión de Hugging Face.
ALOHA engendra toda la línea de conjuntos de datos Mobile ALOHA, ALOHA Unleashed y ALOHA 2, y es la plataforma de referencia para las recetas de tono fino π0 de la Inteligencia Física y las publicaciones de RT-ALOHA y ALOHA-Cosmos-Política de Google.
Cómo descargar y cargar
# Reference hardware / firmware / data
git clone https://github.com/tonyzhaozh/aloha.git
cd aloha && pip install -r requirements.txt
# Download ALOHA static tasks via LeRobot
pip install lerobot
python -c "
from lerobot.common.datasets.lerobot_dataset import LeRobotDataset
d = LeRobotDataset('lerobot/aloha_static_coffee')
print(d[0]['observation.images.top'].shape, d[0]['action'].shape)"
Para el entrenamiento de ACT o Política de difusión en datos ALOHA, el punto de entrada canónico es
Casos de uso comunes y emparejamientos
- Líneas de base de la política de ACT y difusión. El régimen de 50 demostraciones por tarea es el hogar original de la acción; ALOHA es casi siempre el primer punto de referencia para una nueva arquitectura de política bimanual.
- VLA fine-tuning. π0, OpenVLA y RT-2 tienen recetas públicas de ALOHA fine-tuning. Es la forma más rápida de enviar una demostración bimanual de VLA.
- Reproducción abierta de hardware. La cuenta de los materiales de la plataforma y el CAD están abiertos, por lo que los laboratorios comúnmente compran las piezas, reproducen la plataforma exacta y luego contribuyen a las colecciones de tareas.
- ** Manipulación móvil.** Mobile ALOHA añade una base de ruedas; los conjuntos de datos son compatibles con el formato y permiten estudiar la coordinación de todo el cuerpo.
Indicadores de referencia y tablas de clasificación
No hay una tabla de clasificación única porque ALOHA es una plataforma en lugar de una suite fija







