LeRobot: La biblioteca de aprendizaje de robots de código abierto <unk> Guía completa
Todo sobre Hugging Face LeRobot: lo que es, algoritmos ACT/Diffusion Policy/TDMPC, hardware soportado, formato de conjunto de datos, tutorial de arranque rápido y compatibilidad de exportación RCSV.
Parte de: [Guía de recogida de datos de robots]
LeRobot es la biblioteca de código abierto de Hugging Face para el aprendizaje de robots
¿Qué es LeRobot?
LeRobot es una biblioteca Python mantenida por Hugging Face que proporciona una infraestructura de extremo a extremo para la investigación de aprendizaje de robots. Se trata de cuatro temas distintos: grabar demostraciones de robots a partir de hardware real, almacenar y versionar esas demostraciones en un formato de conjunto de datos estandarizado, entrenar las últimas políticas de aprendizaje de imitación y refuerzo de aprendizaje en esos conjuntos de datos, y implementar políticas entrenadas de nuevo en hardware real para la evaluación. Cada una de estas capacidades es modular
El proyecto vive en GitHub bajo la organización huggingface y a principios de 2026 ha acumulado decenas de miles de estrellas y cientos de colaboradores.
Lo que hace que LeRobot sea particularmente valioso es que elimina el trabajo de "sanitación" que cada proyecto de aprendizaje de robot utiliza para duplicar: escribir controladores de cámara, implementar grabación de datos, construir cargadores de conjuntos de datos, configurar bucles de entrenamiento y cablear políticas de regreso al hardware. Antes de LeRobot, cada laboratorio construyó su propia versión de esta infraestructura, que era típicamente frágil, indocumentada e imposible de reproducir para otros laboratorios.
El ecosistema LeRobot
LeRobot se encuentra en el centro de un creciente ecosistema de herramientas, conjuntos de datos y plataformas de hardware:
| Component | Role | Status |
|---|---|---|
| LeRobot Python library | Core framework for recording, training, evaluation | Stable (v0.5+) |
| Hugging Face Hub | Dataset hosting, versioning, community sharing | Production |
| Hardware drivers | ALOHA, Koch, SO-100/101, OpenArm, Lekiwi | Growing (community contributed) |
| Policy implementations | ACT, Diffusion Policy, TDMPC2 | Stable |
| Simulation environments | Aloha sim, PushT, xArm sim | Stable (for testing/dev) |
| Weights & Biases integration | Experiment tracking, loss curves, video logging | Built-in |
Algorithmas compatibles
LeRobot ofrece implementaciones nativas de tres clases de políticas, que cubren los enfoques más utilizados en la investigación del aprendizaje robótico.
ACT (Acción de la pieza con transformadores)
ACT es el algoritmo principal para tareas de manipulación de granos finos. Utiliza una arquitectura CVAE (Conditional Variational Codificador Automático) basada en transformadores con ensamblaje temporal. La innovación clave es "acción chunking"
Punto de partida recomendado para la mayoría de los flujos de trabajo de manipulación hábiles. Configuración típica: 200-500 demostraciones, tamaño de pieza de 100, 4-8 horas de entrenamiento en un solo A100. tasa de éxito esperada: 80-92% en tareas estándar de mesa.
Política de difusión
Implementa las variantes de la difusión de la difusión para predicción de acción basada en CNN y transformadora. La política de difusión sobresale en tareas con distribuciones de acción multimodal
Normalmente se requieren 500-1,000 demostraciones para un buen rendimiento. El entrenamiento dura 8-12 horas en un A100. La inferencia es más lenta que ACT (requiere múltiples pasos de denotación), con una latencia típica de 50-100 ms por pieza de acción dependiendo del número de pasos de denotación (por defecto: 10-15).
TDMPC2
TDMPC2 (Temporal Difference Control Predictivo de Modelos) es un algoritmo RL basado en modelos que aprende tanto un modelo mundial como una política, ofreciendo un entrenamiento eficiente de muestras cuando hay un entorno de simulación disponible. A diferencia de ACT y la Política de Difusión, TDMPC2 no requiere demostraciones humanas.
El modelo mundial permite un comportamiento basado en la planificación que puede generalizarse a nuevas configuraciones mejor que el aprendizaje de imitación pura en algunos entornos.
Cada algoritmo se implementa en PyTorch con guiones de entrenamiento estándar, gestión de configuración de hidra y integración de Pesos y Bias para el seguimiento de experimentos.
El hardware soportado
Las integraciones de hardware fuera de la caja incluyen:
| Platform | Type | DOF | Price Range | RCSV Available |
|---|---|---|---|---|
| ALOHA (ViperX) | Bimanual | 14 (2x7) | $15,000-20,000 | Yes (lab + lease) |
| Koch Arms | Single-arm | 6 | $1,500-3,000 | No |
| SO-100 / SO-101 | Single-arm | 5-6 | $300-800 | No |
| OpenArm 1 | Single-arm | 6 | $4,500 | Yes (store + lease) |
| Lekiwi | Mobile + arm | 6+3 | $2,000-4,000 | No |
El [OpenArm]
El soporte de la cámara cubre las cámaras USB a través de OpenCV, cámaras de profundidad Intel RealSense y matrices de webcam. El sistema de grabación maneja la sincronización de múltiples cámaras con el timestamping del software y admite velocidades de fotogramas configurables y resoluciones por cámara.
El formato del conjunto de datos de LeRobot
LeRobot almacena conjuntos de datos como archivos HDF5 con una estructura de episodios estandarizada. Cada episodio contiene matrices para observaciones (imágenes comprimidas como flujos de video, estados conjuntos como matrices float32), acciones (objetivos de posición conjunta), sellos de tiempo y anotaciones (cuerdas de lenguaje de tarea, banderas de éxito). Este formato está diseñado para ser auto-descriptivo y portátil: un conjunto de datos grabado en una máquina puede cargarse para su formación en cualquier otra máquina sin modificaciones.
La estructura del conjunto de datos se ve así:
dataset/
meta/
info.json # Robot config, camera params, stats
episodes.jsonl # Episode-level metadata
data/
chunk-000/
episode_000000.parquet # State + action data
videos/
chunk-000/
observation.images.top/
episode_000000.mp4 # Compressed camera streams
observation.images.wrist/
episode_000000.mp4
Los conjuntos de datos publicados en Hugging Face Hub incluyen una tarjeta de conjunto de datos con estadísticas, descripciones de tareas y ejemplos de uso. Esto facilita la detección y reutilización de conjuntos de datos de la comunidad, reduciendo la carga de recopilación de datos para tareas comunes.
Comenzando: un tutorial completo
Aquí está el flujo de trabajo completo desde la instalación hasta una política entrenada, suponiendo que tenga hardware o esté utilizando simulación.
Paso 1: Instalación
LeRobot requiere Python 3.10+ y PyTorch 2.0+. Instala desde la fuente para las últimas características:
# Clone and install
git clone https://github.com/huggingface/lerobot.git
cd lerobot
pip install -e ".[all]"
# Verify installation
python -c "import lerobot; print(lerobot.__version__)"
Tiempo total de instalación: 5 a 10 minutos en una máquina con CUDA configurada. Si no tienes CUDA, instale PyTorch con CPU primero, y luego pasar a GPU cuando tengas datos de entrenamiento.
Paso 2: Graba las demostraciones (hardware real)
Si tiene un OpenArm u otro hardware soportado:
# Start recording with teleoperation
python lerobot/scripts/control_robot.py record \
--robot-path lerobot/configs/robot/openarm.yaml \
--fps 30 \
--root data/my_dataset \
--repo-id my-hf-user/my-task-dataset \
--num-episodes 50 \
--warmup-time-s 2 \
--episode-time-s 30 \
--reset-time-s 10
El guión de grabación maneja la sincronización de la cámara, el registro de estado conjunto y la segmentación de episodios. Entre los episodios, tienes
Paso 3: Visualizar y validar los datos
# Visualize recorded episodes
python lerobot/scripts/visualize_dataset.py \
--root data/my_dataset \
--episode-index 0
Revise siempre los primeros 5-10 episodios antes de recoger más. Compruebe: ángulos correctos de la cámara, seguimiento del movimiento de la articulación suave, recorte adecuado de inicio/finales de los episodios y configuración consistente del espacio de trabajo.
Paso 4: Hacer una política
# Train ACT policy on your dataset
python lerobot/scripts/train.py \
policy=act \
dataset_repo_id=my-hf-user/my-task-dataset \
training.num_epochs=2000 \
training.batch_size=8 \
wandb.enable=true
El tiempo de entrenamiento depende del tamaño del conjunto de datos y la GPU. Con 50 episodios en un RTX 4090: aproximadamente 2 horas para ACT, 4 horas para la Política de difusión. En un A100: aproximadamente el 60% de esos tiempos. Monitorear el entrenamiento a través del panel de control de Pesas y Prejuicios
Paso 5: Evaluar el hardware real
# Deploy trained policy
python lerobot/scripts/control_robot.py record \
--robot-path lerobot/configs/robot/openarm.yaml \
--fps 30 \
--root data/eval_dataset \
--repo-id my-hf-user/my-task-eval \
--num-episodes 20 \
--policy-overrides policy.path=outputs/train/act/checkpoints/last/pretrained_model
Ejecutar al menos 20 episodios de evaluación en diferentes posiciones de objetos para obtener una estimación fiable de la tasa de éxito.
Cómo el hardware RCSV se integra con LeRobot
El ecosistema de hardware de RCSV está diseñado para la compatibilidad nativa de LeRobot:
OpenArm 1: Naves con un archivo YAML de configuración robot LeRobot. Enchufe en el tablero de control, ejecute el guión de control LeRobot, y se grabarán demostraciones en cuestión de minutos. El sistema de teleoperación líder-seguidor mapea directamente a la interfaz de grabación de LeRobot. Consulte nuestra Guía de configuración de OpenArm para el proceso completo de configuración de hardware.
DK1 Bimanual: Configurado como un sistema bimanual compatible con ALOHA en LeRobot. Ambos brazos son accesibles a través de una sola configuración de robot.
Integración de la plataforma RCSV: Los conjuntos de datos recogidos a través de la plataforma RCSV se pueden exportar directamente en formato LeRobot con un solo clic. La exportación incluye todos los metadatos necesarios: intrínsecos de la cámara, URDF robot, anotaciones de episodios y etiquetas de éxito. No se necesita conversión manual de formato.
El centro de datos comunitario
Una de las características más poderosas de LeRobot es la integración de Hugging Face Hub para compartir conjuntos de datos. A principios de 2026, el Hub alberga cientos de conjuntos de datos de aprendizaje de robots de la comunidad, que cubren:
- Punto y lugar con varias plataformas de brazos y conjuntos de objetos
- ALOHA tareas bimanual (cocción, plegado, montaje)
- Desafíos y puntos de referencia de la comunidad SO-100
- Manipulación móvil con Lekiwi y plataformas personalizadas
- Datos de simulación para PushT y otras tareas de referencia
Puede navegar por los conjuntos de datos disponibles en
Encabezos y soluciones comunes
- Cámara de cámara caída: límites de ancho de banda USB. Si ejecuta 3+ cámaras USB a través de un solo controlador USB, obtendrá caídas de marco. Solución: utilizar una tarjeta USB PCIe con controladores independientes, o reducir la resolución/marcado de la cámara.
- Tiempo de retraso de comunicación de servidor: El bus en serie Dynamixel puede retraso en el tráfico. Reducir el número de paquetes de retorno de estado al ajustar el retraso de retorno al mínimo en la configuración de servidor.
- Diverencia de formación: Si la pérdida aumenta después de la disminución inicial, reduzca la tasa de aprendizaje en 2-5x. ACT es sensible a la tasa de aprendizaje
comienza en 1e-5 y aumenta sólo si la convergencia es demasiado lenta. - ** Tensión política durante la implementación:** Aumente el tamaño de la ventana del conjunto temporal en la configuración ACT. El valor predeterminado es a menudo demasiado pequeño para tareas lentas y deliberadas.
- ** Desalineamiento de timestamp de episodios:** LeRobot utiliza timestamps de software. Para tareas de alta precisión que requieren sincronización <10ms, considere el desencadenamiento de hardware para cámaras y el uso del timestamp de desencadenamiento de hardware como el reloj principal.
Compatibilidad con las exportaciones de RCSV
La plataforma de datos de RCSV exporta conjuntos de datos en formato nativo LeRobot HDF5, con todos los campos de metadatos requeridos llenados desde la sesión de grabación. Los conjuntos de datos recopilados a través de las instalaciones o servicios de recopilación de datos de RCSV llegan listos para la capacitación
Si tiene preguntas sobre la integración de datos de RCSV con su línea de formación LeRobot, el equipo de ingeniería de RCSV está disponible para ayudarle.
LeRobot vs. Otros marcos
| Framework | Best For | Limitations |
|---|---|---|
| LeRobot | End-to-end IL on real hardware, community datasets | Limited RL support, no sim-to-real pipeline |
| Isaac Lab | GPU-parallelized RL in simulation | No real hardware support, simulation only |
| RoboCasa / MimicGen | Synthetic data generation for household tasks | Simulation only, no real hardware |
| Octo / OpenVLA | Foundation model fine-tuning | Requires pre-trained weights, less flexible |
Para la mayoría de los equipos que inician un nuevo proyecto de aprendizaje de robots, LeRobot es la opción predeterminada correcta. Utilice Isaac Lab para RL en la simulación (ver nuestra guía de Isaac Lab) y considere Octo/OpenVLA para ajustar el modelo de base una vez que tenga una política de base.
Las profundidades de LeRobot
- [LeRobot Quickstart Tutorial]
T15 ) Paso a paso: instalar, grabar 50 demostraciones, entrenar ACT en menos de 2 horas - [Referencia de integración de LeRobot (Wiki) ]
T16 ) Guía completa de integración de desarrolladores para DK1, SO-101, OpenArm - HDF5 vs RLDS vs LeRobot Dataset Formats Comparado
cuándo utilizar cada uno y cómo convertirlo - Formato de Conjunto de Datos LeRobot Explained
Parquet + MP4 schema reference - Definición del Marco de LeRobot
Entrada concisa en el glosario - LeRobot Open-Source Datasets
Hub de conjunto de datos de la comunidad de visión general - Modelos de política de LeRobot (ACT, SmolVLA)
referencia de arquitectura de modelo - Solucionar problemas de datos de LeRobot
Diagnóstico de problemas de configuración y fallos de recogida - [Guía de integración de datos de LeRobot]
T23 ) Flujos de trabajo de cableado, software y seguridad - [Guía de configuración de OpenArm]
T24 ) configuración de hardware para LeRobot - [RL vs Imitación]
T25 ) elegir su enfoque - [Isaac Lab Comienza]
T26 ) RL en la simulación - [Servicios de datos de la RCSV]
T27 ) Recopilación profesional de datos - [RCSV Store]
T28 ) OpenArm y sus componentes
Comience con el hardware LeRobot + RCSV
RCSV OpenArm tiene soporte nativo de LeRobot. Compra uno en la tienda ($ 4,500) o arrendamiento a partir de $ 800 / mes. Los datos recogidos a través de las exportaciones de RCSV directamente al formato LeRobot.
[Brasar el hardware] [







