Volver a Blog

LeRobot: La biblioteca de aprendizaje de robots de código abierto <unk> Guía completa

Todo sobre Hugging Face LeRobot: lo que es, algoritmos ACT/Diffusion Policy/TDMPC, hardware soportado, formato de conjunto de datos, tutorial de arranque rápido y compatibilidad de exportación RCSV.

Parte de: [Guía de recogida de datos de robots]

LeRobot es la biblioteca de código abierto de Hugging Face para el aprendizaje de robots un marco unificado que cubre la recopilación de datos, el almacenamiento de conjuntos de datos, la capacitación política y las interfaces de hardware para las plataformas de investigación más utilizadas. Se ha convertido en el punto de partida predeterminado para nuevos proyectos de aprendizaje de robots en 2025 y 2026.

¿Qué es LeRobot?

LeRobot es una biblioteca Python mantenida por Hugging Face que proporciona una infraestructura de extremo a extremo para la investigación de aprendizaje de robots. Se trata de cuatro temas distintos: grabar demostraciones de robots a partir de hardware real, almacenar y versionar esas demostraciones en un formato de conjunto de datos estandarizado, entrenar las últimas políticas de aprendizaje de imitación y refuerzo de aprendizaje en esos conjuntos de datos, y implementar políticas entrenadas de nuevo en hardware real para la evaluación. Cada una de estas capacidades es modular se puede utilizar LeRobot para el almacenamiento de datos sólo, o para el entrenamiento y la implementación de la pila completa.

El proyecto vive en GitHub bajo la organización huggingface y a principios de 2026 ha acumulado decenas de miles de estrellas y cientos de colaboradores.

Lo que hace que LeRobot sea particularmente valioso es que elimina el trabajo de "sanitación" que cada proyecto de aprendizaje de robot utiliza para duplicar: escribir controladores de cámara, implementar grabación de datos, construir cargadores de conjuntos de datos, configurar bucles de entrenamiento y cablear políticas de regreso al hardware. Antes de LeRobot, cada laboratorio construyó su propia versión de esta infraestructura, que era típicamente frágil, indocumentada e imposible de reproducir para otros laboratorios.

El ecosistema LeRobot

LeRobot se encuentra en el centro de un creciente ecosistema de herramientas, conjuntos de datos y plataformas de hardware:

Component Role Status
LeRobot Python library Core framework for recording, training, evaluation Stable (v0.5+)
Hugging Face Hub Dataset hosting, versioning, community sharing Production
Hardware drivers ALOHA, Koch, SO-100/101, OpenArm, Lekiwi Growing (community contributed)
Policy implementations ACT, Diffusion Policy, TDMPC2 Stable
Simulation environments Aloha sim, PushT, xArm sim Stable (for testing/dev)
Weights & Biases integration Experiment tracking, loss curves, video logging Built-in

Algorithmas compatibles

LeRobot ofrece implementaciones nativas de tres clases de políticas, que cubren los enfoques más utilizados en la investigación del aprendizaje robótico.

ACT (Acción de la pieza con transformadores)

ACT es el algoritmo principal para tareas de manipulación de granos finos. Utiliza una arquitectura CVAE (Conditional Variational Codificador Automático) basada en transformadores con ensamblaje temporal. La innovación clave es "acción chunking" predicción de secuencias de acciones futuras en lugar de acciones individuales que reduce el error de composición y produce trayectorias más suaves.

Punto de partida recomendado para la mayoría de los flujos de trabajo de manipulación hábiles. Configuración típica: 200-500 demostraciones, tamaño de pieza de 100, 4-8 horas de entrenamiento en un solo A100. tasa de éxito esperada: 80-92% en tareas estándar de mesa.

Política de difusión

Implementa las variantes de la difusión de la difusión para predicción de acción basada en CNN y transformadora. La política de difusión sobresale en tareas con distribuciones de acción multimodal situaciones en las que hay múltiples enfoques válidos para la tarea (por ejemplo, recoger un objeto de ambos lados).

Normalmente se requieren 500-1,000 demostraciones para un buen rendimiento. El entrenamiento dura 8-12 horas en un A100. La inferencia es más lenta que ACT (requiere múltiples pasos de denotación), con una latencia típica de 50-100 ms por pieza de acción dependiendo del número de pasos de denotación (por defecto: 10-15).

TDMPC2

TDMPC2 (Temporal Difference Control Predictivo de Modelos) es un algoritmo RL basado en modelos que aprende tanto un modelo mundial como una política, ofreciendo un entrenamiento eficiente de muestras cuando hay un entorno de simulación disponible. A diferencia de ACT y la Política de Difusión, TDMPC2 no requiere demostraciones humanas.

El modelo mundial permite un comportamiento basado en la planificación que puede generalizarse a nuevas configuraciones mejor que el aprendizaje de imitación pura en algunos entornos.

Cada algoritmo se implementa en PyTorch con guiones de entrenamiento estándar, gestión de configuración de hidra y integración de Pesos y Bias para el seguimiento de experimentos.

El hardware soportado

Las integraciones de hardware fuera de la caja incluyen:

Platform Type DOF Price Range RCSV Available
ALOHA (ViperX) Bimanual 14 (2x7) $15,000-20,000 Yes (lab + lease)
Koch Arms Single-arm 6 $1,500-3,000 No
SO-100 / SO-101 Single-arm 5-6 $300-800 No
OpenArm 1 Single-arm 6 $4,500 Yes (store + lease)
Lekiwi Mobile + arm 6+3 $2,000-4,000 No

El [OpenArm]T9), disponible a través de la [tienda]T10 de RCSV, tiene soporte nativo de LeRobot para la grabación de teleoperaciones y la implementación de políticas.

El soporte de la cámara cubre las cámaras USB a través de OpenCV, cámaras de profundidad Intel RealSense y matrices de webcam. El sistema de grabación maneja la sincronización de múltiples cámaras con el timestamping del software y admite velocidades de fotogramas configurables y resoluciones por cámara.

El formato del conjunto de datos de LeRobot

LeRobot almacena conjuntos de datos como archivos HDF5 con una estructura de episodios estandarizada. Cada episodio contiene matrices para observaciones (imágenes comprimidas como flujos de video, estados conjuntos como matrices float32), acciones (objetivos de posición conjunta), sellos de tiempo y anotaciones (cuerdas de lenguaje de tarea, banderas de éxito). Este formato está diseñado para ser auto-descriptivo y portátil: un conjunto de datos grabado en una máquina puede cargarse para su formación en cualquier otra máquina sin modificaciones.

La estructura del conjunto de datos se ve así:

dataset/
  meta/
    info.json          # Robot config, camera params, stats
    episodes.jsonl     # Episode-level metadata
  data/
    chunk-000/
      episode_000000.parquet   # State + action data
    videos/
      chunk-000/
        observation.images.top/
          episode_000000.mp4   # Compressed camera streams
        observation.images.wrist/
          episode_000000.mp4

Los conjuntos de datos publicados en Hugging Face Hub incluyen una tarjeta de conjunto de datos con estadísticas, descripciones de tareas y ejemplos de uso. Esto facilita la detección y reutilización de conjuntos de datos de la comunidad, reduciendo la carga de recopilación de datos para tareas comunes.

Comenzando: un tutorial completo

Aquí está el flujo de trabajo completo desde la instalación hasta una política entrenada, suponiendo que tenga hardware o esté utilizando simulación.

Paso 1: Instalación

LeRobot requiere Python 3.10+ y PyTorch 2.0+. Instala desde la fuente para las últimas características:

# Clone and install
git clone https://github.com/huggingface/lerobot.git
cd lerobot
pip install -e ".[all]"

# Verify installation
python -c "import lerobot; print(lerobot.__version__)"

Tiempo total de instalación: 5 a 10 minutos en una máquina con CUDA configurada. Si no tienes CUDA, instale PyTorch con CPU primero, y luego pasar a GPU cuando tengas datos de entrenamiento.

Paso 2: Graba las demostraciones (hardware real)

Si tiene un OpenArm u otro hardware soportado:

# Start recording with teleoperation
python lerobot/scripts/control_robot.py record \
  --robot-path lerobot/configs/robot/openarm.yaml \
  --fps 30 \
  --root data/my_dataset \
  --repo-id my-hf-user/my-task-dataset \
  --num-episodes 50 \
  --warmup-time-s 2 \
  --episode-time-s 30 \
  --reset-time-s 10

El guión de grabación maneja la sincronización de la cámara, el registro de estado conjunto y la segmentación de episodios. Entre los episodios, tienes T6 segundos para restablecer el espacio de trabajo antes de que comience automáticamente la siguiente grabación.

Paso 3: Visualizar y validar los datos

# Visualize recorded episodes
python lerobot/scripts/visualize_dataset.py \
  --root data/my_dataset \
  --episode-index 0

Revise siempre los primeros 5-10 episodios antes de recoger más. Compruebe: ángulos correctos de la cámara, seguimiento del movimiento de la articulación suave, recorte adecuado de inicio/finales de los episodios y configuración consistente del espacio de trabajo.

Paso 4: Hacer una política

# Train ACT policy on your dataset
python lerobot/scripts/train.py \
  policy=act \
  dataset_repo_id=my-hf-user/my-task-dataset \
  training.num_epochs=2000 \
  training.batch_size=8 \
  wandb.enable=true

El tiempo de entrenamiento depende del tamaño del conjunto de datos y la GPU. Con 50 episodios en un RTX 4090: aproximadamente 2 horas para ACT, 4 horas para la Política de difusión. En un A100: aproximadamente el 60% de esos tiempos. Monitorear el entrenamiento a través del panel de control de Pesas y Prejuicios buscar convergencia de pérdidas y revisar los despliegues de acción generados.

Paso 5: Evaluar el hardware real

# Deploy trained policy
python lerobot/scripts/control_robot.py record \
  --robot-path lerobot/configs/robot/openarm.yaml \
  --fps 30 \
  --root data/eval_dataset \
  --repo-id my-hf-user/my-task-eval \
  --num-episodes 20 \
  --policy-overrides policy.path=outputs/train/act/checkpoints/last/pretrained_model

Ejecutar al menos 20 episodios de evaluación en diferentes posiciones de objetos para obtener una estimación fiable de la tasa de éxito.

Cómo el hardware RCSV se integra con LeRobot

El ecosistema de hardware de RCSV está diseñado para la compatibilidad nativa de LeRobot:

OpenArm 1: Naves con un archivo YAML de configuración robot LeRobot. Enchufe en el tablero de control, ejecute el guión de control LeRobot, y se grabarán demostraciones en cuestión de minutos. El sistema de teleoperación líder-seguidor mapea directamente a la interfaz de grabación de LeRobot. Consulte nuestra Guía de configuración de OpenArm para el proceso completo de configuración de hardware.

DK1 Bimanual: Configurado como un sistema bimanual compatible con ALOHA en LeRobot. Ambos brazos son accesibles a través de una sola configuración de robot.

Integración de la plataforma RCSV: Los conjuntos de datos recogidos a través de la plataforma RCSV se pueden exportar directamente en formato LeRobot con un solo clic. La exportación incluye todos los metadatos necesarios: intrínsecos de la cámara, URDF robot, anotaciones de episodios y etiquetas de éxito. No se necesita conversión manual de formato.

El centro de datos comunitario

Una de las características más poderosas de LeRobot es la integración de Hugging Face Hub para compartir conjuntos de datos. A principios de 2026, el Hub alberga cientos de conjuntos de datos de aprendizaje de robots de la comunidad, que cubren:

  • Punto y lugar con varias plataformas de brazos y conjuntos de objetos
  • ALOHA tareas bimanual (cocción, plegado, montaje)
  • Desafíos y puntos de referencia de la comunidad SO-100
  • Manipulación móvil con Lekiwi y plataformas personalizadas
  • Datos de simulación para PushT y otras tareas de referencia

Puede navegar por los conjuntos de datos disponibles en T7 y cargar cualquiera de ellos en su pipeline de capacitación con una sola línea de configuración. Este enfoque normalmente logra el 80-90% del rendimiento de la formación a gran escala desde cero con 5-10 veces menos datos personalizados.

Encabezos y soluciones comunes

  • Cámara de cámara caída: límites de ancho de banda USB. Si ejecuta 3+ cámaras USB a través de un solo controlador USB, obtendrá caídas de marco. Solución: utilizar una tarjeta USB PCIe con controladores independientes, o reducir la resolución/marcado de la cámara.
  • Tiempo de retraso de comunicación de servidor: El bus en serie Dynamixel puede retraso en el tráfico. Reducir el número de paquetes de retorno de estado al ajustar el retraso de retorno al mínimo en la configuración de servidor.
  • Diverencia de formación: Si la pérdida aumenta después de la disminución inicial, reduzca la tasa de aprendizaje en 2-5x. ACT es sensible a la tasa de aprendizaje comienza en 1e-5 y aumenta sólo si la convergencia es demasiado lenta.
  • ** Tensión política durante la implementación:** Aumente el tamaño de la ventana del conjunto temporal en la configuración ACT. El valor predeterminado es a menudo demasiado pequeño para tareas lentas y deliberadas.
  • ** Desalineamiento de timestamp de episodios:** LeRobot utiliza timestamps de software. Para tareas de alta precisión que requieren sincronización <10ms, considere el desencadenamiento de hardware para cámaras y el uso del timestamp de desencadenamiento de hardware como el reloj principal.

Compatibilidad con las exportaciones de RCSV

La plataforma de datos de RCSV exporta conjuntos de datos en formato nativo LeRobot HDF5, con todos los campos de metadatos requeridos llenados desde la sesión de grabación. Los conjuntos de datos recopilados a través de las instalaciones o servicios de recopilación de datos de RCSV llegan listos para la capacitación no se requiere ningún paso de conversión.

Si tiene preguntas sobre la integración de datos de RCSV con su línea de formación LeRobot, el equipo de ingeniería de RCSV está disponible para ayudarle.

LeRobot vs. Otros marcos

Framework Best For Limitations
LeRobot End-to-end IL on real hardware, community datasets Limited RL support, no sim-to-real pipeline
Isaac Lab GPU-parallelized RL in simulation No real hardware support, simulation only
RoboCasa / MimicGen Synthetic data generation for household tasks Simulation only, no real hardware
Octo / OpenVLA Foundation model fine-tuning Requires pre-trained weights, less flexible

Para la mayoría de los equipos que inician un nuevo proyecto de aprendizaje de robots, LeRobot es la opción predeterminada correcta. Utilice Isaac Lab para RL en la simulación (ver nuestra guía de Isaac Lab) y considere Octo/OpenVLA para ajustar el modelo de base una vez que tenga una política de base.

Las profundidades de LeRobot

Comience con el hardware LeRobot + RCSV

RCSV OpenArm tiene soporte nativo de LeRobot. Compra uno en la tienda ($ 4,500) o arrendamiento a partir de $ 800 / mes. Los datos recogidos a través de las exportaciones de RCSV directamente al formato LeRobot.

[Brasar el hardware] [T29] [Alquilar un OpenArm] [T30)