Zurück zu Blog

LeRobot: Die Open-Source-Roboter-Lernbibliothek <unk> Vollständiger Leitfaden

Alles über Hugging Face LeRobot: was es ist, ACT/Diffusion Policy/TDMPC-Algorithmen, unterstützte Hardware, Datensatzformat, Quickstart-Tutorial und RCSV-Exportkompatibilität.

Teil von: [Roboter-Daten-Sammlungsanleitung]

LeRobot ist Hugging Face Open-Source-Bibliothek für Roboter-Lernen ein einheitliches Framework, das Datenverwertung, Datensatzspeicherung, politische Ausbildung und Hardware-Schnittstellen für die am häufigsten verwendeten Forschungsplattformen abdeckt. Es ist der Standard-Startpunkt für neue Roboter-Lernprojekte in 2025 und 2026 geworden.

Was ist LeRobot?

LeRobot ist eine Python-Bibliothek, die von Hugging Face gepflegt wird und end-to-end-Infrastruktur für die Roboter-Lernforschung bietet. Es befasst sich mit vier verschiedenen Problemen: die Aufzeichnung von Roboterdemonstrationen aus echter Hardware, die Speicherung und Version dieser Demonstrationen in einem standardisierten Datensatzformat, die Ausbildung von modernsten Imitations- und Verstärkungslernungsrichtlinien auf diesen Datensätzen und die Bereitstellung von geschulten Richtlinien zurück in die reale Hardware zur Bewertung. Jede dieser Funktionen ist modular Sie können LeRobot nur für die Datenspeicherung oder für die Aus- und Bereitstellung von Full-Stack verwenden.

Das Projekt lebt auf GitHub unter der huggingface Organisation und hat Anfang 2026 Zehntausende von Stars und Hunderte von Mitarbeitern angesammelt. Datensätze können auf den Hugging Face Hub veröffentlicht und heruntergeladen werden, was LeRobot ein wachsendes gemeinsames Datensatzrepository gibt, das als Community-Datenmarktplatz dient.

Was LeRobot besonders wertvoll macht, ist, dass es die "Stuhlwerk" -Arbeit beseitigt, die jedes Roboter-Lernprojekt zu kopieren verwendet: Schreiben von Kamera-Treibern, Implementieren von Datenaufzeichnung, Bauen von Datensatz-Ladern, Einrichtung von Trainingsschleifern und Verkabelung von Richtlinien zurück zur Hardware. Vor LeRobot baute jedes Labor seine eigene Version dieser Infrastruktur auf, die typischerweise zerbrechlich, undokumentiert und unmöglich für andere Labors war, sich zu reproduzieren.

Das LeRobot-Ökosystem

LeRobot steht im Zentrum eines wachsenden Ökosystems von Tools, Datensätzen und Hardware-Plattformen:

Component Role Status
LeRobot Python library Core framework for recording, training, evaluation Stable (v0.5+)
Hugging Face Hub Dataset hosting, versioning, community sharing Production
Hardware drivers ALOHA, Koch, SO-100/101, OpenArm, Lekiwi Growing (community contributed)
Policy implementations ACT, Diffusion Policy, TDMPC2 Stable
Simulation environments Aloha sim, PushT, xArm sim Stable (for testing/dev)
Weights & Biases integration Experiment tracking, loss curves, video logging Built-in

Unterstützte Algorithmen

LeRobot liefert native Implementierungen von drei Politikklassen, die die am weitesten verbreiteten Ansätze in der Forschung zum Lernen von Robotern abdecken.

ACT (Action Chunking mit Transformatoren)

ACT ist der primäre Algorithmus für feine Korn-Manipulation-Aufgaben. Es verwendet eine transformatorbasierte CVAE (Conditional Variational Autoencoder) Architektur mit zeitlicher Ensembling. Die Schlüsselinnovation ist "Action Chunking" Vorhersage von Sequenzen zukünftiger Aktionen anstatt einzelner Aktionen , die Zusammenschlussfehler reduziert und reibungslose Bahnen erzeugt.

Empfehlungspunkt für die meisten geschickten Manipulations-Workflows. Typische Konfiguration: 200-500 Demonstrationen, Stückgröße 100, 4-8 Stunden Training auf einem einzigen A100. Erwartete Erfolgsrate: 80-92% bei Standard-Tasks auf dem Tisch.

Diffusionspolitik

Die Diffusion Policy übertrifft bei Aufgaben mit multimodalen Aktionsverteilungen Situationen, in denen mehrere gültige Ansätze zur Aufgabe (z. B. das Abholen eines Objekts von beiden Seiten) vorliegen.

Für eine starke Leistung sind typischerweise 500 bis 1000 Demonstrationen erforderlich. Das Training dauert 8 bis 12 Stunden auf einem A100. Die Inferenz ist langsamer als ACT (verlangt mehrere Denotationsschritte), wobei die typische Latenz je Aktionsstück 50 bis 100 ms je nach Anzahl der Denotationsschritte (Standard: 10-15) beträgt.

TDMPC2

TDMPC2 (Temporal Difference Modellprädiktive Regelung) ist ein modellbasierter RL-Algorithmus, der sowohl ein Weltmodell als auch eine Politik lernt und eine sample-effiziente Ausbildung anbietet, wenn eine Simulationsumgebung verfügbar ist. Im Gegensatz zu ACT und Diffusion Policy erfordert TDMPC2 keine menschlichen Demonstrationen.

Das Weltmodell ermöglicht ein planbasiertes Verhalten, das sich in einigen Einstellungen besser auf neue Konfigurationen verallgemeinern kann als reines Imitationslernen.

Jeder Algorithmus wird in PyTorch mit Standard-Trainingscripts, Hydra-Konfigurationsmanagement und Weights & Biases-Integration für das Experiment-Tracking implementiert.

Unterstützte Hardware

Die Hardware-Integrationen außerhalb der Box umfassen:

Platform Type DOF Price Range RCSV Available
ALOHA (ViperX) Bimanual 14 (2x7) $15,000-20,000 Yes (lab + lease)
Koch Arms Single-arm 6 $1,500-3,000 No
SO-100 / SO-101 Single-arm 5-6 $300-800 No
OpenArm 1 Single-arm 6 $4,500 Yes (store + lease)
Lekiwi Mobile + arm 6+3 $2,000-4,000 No

Die [OpenArm] (T9), die über den [Store] von RCSV (T10) verfügbar ist, verfügt über native LeRobot-Unterstützung für die Teleoperationsaufzeichnung und die Bereitstellung von Richtlinien.

Die Kamera-Unterstützung umfasst USB-Kameras über OpenCV, Intel RealSense-Tiefengekameras und Webcam-Arrays. Das Aufnahmesystem verwaltet die Synchronisierung von mehreren Kameras mit Software-Zeitmarkierung und unterstützt konfigurierbare Bildschraubraten und Auflösungen pro Kamera.

Das Format des LeRobot Datensatzes

LeRobot speichert Datensätze als HDF5-Dateien mit einer standardisierten Episode-Struktur. Jede Episode enthält Arrays für Beobachtungen (Bilder, die als Video-Streams komprimiert werden, gemeinsame Zustände als float32-Arrays), Aktionen (gemeinsame Positionsziele), Zeitstempel und Anmerkungen (Task-Sprachensätze, Erfolgsflaggen). Metadatendateien beschreiben die Roboterkonfiguration, die Kamerakalibrierung und Datensatzstatistiken. Dieses Format ist selbstbeschreibend und tragbar: Ein auf einer Maschine aufgezeichnetes Datensatz kann ohne Änderung für die Ausbildung auf jeder anderen Maschine geladen werden.

Die Datensatzstruktur sieht so aus:

dataset/
  meta/
    info.json          # Robot config, camera params, stats
    episodes.jsonl     # Episode-level metadata
  data/
    chunk-000/
      episode_000000.parquet   # State + action data
    videos/
      chunk-000/
        observation.images.top/
          episode_000000.mp4   # Compressed camera streams
        observation.images.wrist/
          episode_000000.mp4

Die auf dem Hugging Face Hub veröffentlichten Datensätze umfassen eine Datensatzkarte mit Statistiken, Aufgabenbeschreibungen und Nutzungsbeispielen. Dies erleichtert die Entdeckung und Wiederverwendung von Datensätzen aus der Community und reduziert die Datenerhebung für gemeinsame Aufgaben.

Ein Anfang: Ein vollständiges Tutorial

Hier ist der vollständige Workflow von der Installation bis zu einer ausgebildeten Politik, vorausgesetzt, Sie haben Hardware oder verwenden Simulation.

Schritt 1: Installation

LeRobot benötigt Python 3.10+ und PyTorch 2.0+. Installieren Sie die neuesten Funktionen aus der Quelle:

# Clone and install
git clone https://github.com/huggingface/lerobot.git
cd lerobot
pip install -e ".[all]"

# Verify installation
python -c "import lerobot; print(lerobot.__version__)"

Die Installationszeit beträgt insgesamt 5 bis 10 Minuten auf einem Computer mit CUDA, das bereits konfiguriert ist.

Schritt 2: Aufzeichnen von Demonstrationen (echte Hardware)

Wenn Sie eine OpenArm oder andere unterstützte Hardware haben:

# Start recording with teleoperation
python lerobot/scripts/control_robot.py record \
  --robot-path lerobot/configs/robot/openarm.yaml \
  --fps 30 \
  --root data/my_dataset \
  --repo-id my-hf-user/my-task-dataset \
  --num-episodes 50 \
  --warmup-time-s 2 \
  --episode-time-s 30 \
  --reset-time-s 10

Das Aufnahmeschreiben verwaltet die Kamera-Synchronisierung, die gemeinsame Zustandsprotokollierung und die Episodesegmentierung. Zwischen Episoden haben Sie T6 Sekunden Zeit, um den Arbeitsplatz zurückzusetzen, bevor die nächste Aufnahme automatisch startet.

Schritt 3: Visualisieren und validieren Sie Daten

# Visualize recorded episodes
python lerobot/scripts/visualize_dataset.py \
  --root data/my_dataset \
  --episode-index 0

Überprüfen Sie immer Ihre ersten 5-10 Episoden, bevor Sie mehr sammeln. Überprüfen Sie nach: richtigen Kamerawinkel, reibungslosem Bewegungsverfolgen, richtigen Beginn/Ende-Schnitt und konsistenten Arbeitsplatz-Einstellungen. Frühe Probleme zu erfassen spart Stunden an Wieder-Sammlung.

Schritt 4: Ein Plan ausarbeiten

# Train ACT policy on your dataset
python lerobot/scripts/train.py \
  policy=act \
  dataset_repo_id=my-hf-user/my-task-dataset \
  training.num_epochs=2000 \
  training.batch_size=8 \
  wandb.enable=true

Die Trainingszeit hängt von der Datensatzgröße und GPU ab. Mit 50 Episoden auf einem RTX 4090: ca. 2 Stunden für ACT, 4 Stunden für Diffusion Policy. Auf einem A100: ca. 60% dieser Zeiten. Überwachen Sie das Training über das Dashboard Weights & Biases suchen Sie nach Verlustkonvergenz und überprüfen Sie die erzeugten Aktionsrolls.

Schritt 5: Beurteilen Sie die Echtware

# Deploy trained policy
python lerobot/scripts/control_robot.py record \
  --robot-path lerobot/configs/robot/openarm.yaml \
  --fps 30 \
  --root data/eval_dataset \
  --repo-id my-hf-user/my-task-eval \
  --num-episodes 20 \
  --policy-overrides policy.path=outputs/train/act/checkpoints/last/pretrained_model

Führen Sie mindestens 20 Evaluationsepisoden in verschiedenen Objektenpositionen durch, um eine zuverlässige Erfolgsraten-Schätzung zu erhalten.

Wie sich RCSV-Hardware mit LeRobot integriert

Das Hardware-Ökosystem von RCSV ist für die native LeRobot-Kompatibilität konzipiert:

OpenArm 1: Schiffe mit einer LeRobot-Roboter-Konfiguration YAML-Datei. Stecken Sie in das Steuerablatt ein, laufen Sie das LeRobot-Steuerungs Skript aus und Sie werden innerhalb von Minuten Demonstrationen aufnehmen. Das Führer-Follower-Teleoperationssystem kartiert direkt auf die Aufnahmeschnittstelle von LeRobot. Siehe unseren OpenArm-Setup-Leitfaden für den kompletten Hardware-Setup-Walkthrough.

DK1 Bimanual: Konfigurert als ALOHA-kompatibles Bimanualsystem in LeRobot. Beide Arme sind über eine einzige Roboterkonfiguration zugänglich.

RCSV-Plattformintegration: Die über die RCSV-Plattform gesammelten Datensätze können direkt mit einem einzigen Klick im LeRobot-Format exportiert werden. Der Export umfasst alle erforderlichen Metadaten: Kamera-Intrinsics, Roboter URDF, Episode-Annotationen und Erfolgsetiketten.

Das Gemeinschaftsdatensatz-Hub

Eine der leistungsstärksten Funktionen von LeRobot ist die Integration von Hugging Face Hub für Datensatz-Teilung.

  • Auswahl- und Platzierung mit verschiedenen Armblattformen und Objekten
  • ALOHA Doppelarbeit (Küchen, Falten, Montage)
  • SO-100-Gemeinschaftsprobleme und -Benchmarks
  • Mobilfunkmanipulation mit Lekiwi und benutzerdefinierten Plattformen
  • Simulationsdatenmengen für PushT und andere Benchmark-Aufgaben

Sie können die verfügbaren Datensätze unter T7 durchsuchen und jede dieser Daten mit einer einzigen Konfigurationslinie in Ihre Trainingspipeline laden. Dieser Ansatz erreicht in der Regel 80-90% der Leistung von groß angelegten Ausbildungsmaßnahmen von Grund auf mit 5-10 mal weniger benutzerdefinierten Daten.

Häufige Fallstricke und Problemlösungen

  • ** Kamera-Rahmen fallen:** USB-Bandbreite-Grenzen. Wenn Sie 3+ USB-Kameras über einen einzigen USB-Controller ausführen, erhalten Sie Frame-Drops.
  • Servo-Kommunikationszeit: Dynamixel-Seriebus kann unter hohem Verkehrsverkehrsverkehrszeitraum auslaufen.
  • Ausbildungsdifferenz: Wenn der Verlust nach dem ersten Abbau steigt, senken Sie die Lernrate um 2-5x. ACT ist für Lernrate empfindlich Beginnen Sie bei 1e-5 und erhöhen Sie sich nur, wenn die Konvergenz zu langsam ist.
  • Politik-Jitter während des Einsatzes: Steigern Sie die Zeit-Anschlussfenstergröße in der ACT-Konfiguration.
  • ** Episodenzeitstempelverschiebung:** LeRobot verwendet Softwarezeitstempeln. Für hochpräzise Aufgaben, die <10ms Synchronisierung erfordern, sollten Sie die Hardware-Auslösung für Kameras und den Hardware-Auslösungszeitstempel als primäre Uhr verwenden.

RCSV-Exportvereinbarkeit

Die [Datenplattform] von RCSV exportiert Datensätze im nativen LeRobot HDF5-Format, wobei alle benötigten Metadatenfelder aus der Aufnahmebesetzung ausgefüllt sind. Datensätze, die über die Einrichtung oder die Datenerhebungdienste von RCSV gesammelt werden, sind bereit für das Training.

Wenn Sie Fragen zur Integration von RCSV-Daten in Ihre LeRobot-Ausbildungsleitung haben, ist das [RCSV-Ingenieurteam]T13) zur Verfügung, um Ihnen zu helfen.

LeRobot vs. andere Rahmenwerke

Framework Best For Limitations
LeRobot End-to-end IL on real hardware, community datasets Limited RL support, no sim-to-real pipeline
Isaac Lab GPU-parallelized RL in simulation No real hardware support, simulation only
RoboCasa / MimicGen Synthetic data generation for household tasks Simulation only, no real hardware
Octo / OpenVLA Foundation model fine-tuning Requires pre-trained weights, less flexible

Für die meisten Teams, die ein neues Roboter-Lernprojekt starten, ist LeRobot die richtige Standardwahl.

Diepste Tauchen von LeRobot

Beginnen Sie mit LeRobot + RCSV Hardware

Die OpenArm von RCSV unterstützt LeRobot. Kaufen Sie eine im Geschäft ($ 4.500) oder mieten Sie ab $ 800 / Monat.

Browse Hardware Lease an OpenArm