Zurück zu Learn

Roboter lernen, wie sie sich imitieren: Von Verhaltensklonung bis zu Verbreitungspolitik

Eine klare Einführung in das Imitationslernen <unk> Verhaltensklonung, Verteilungsschicht, DAgger, Action Chunking und Diffusionspolitik erklärt.

[← Lernen]

Erfahren Sie, wie Roboter Fähigkeiten aus menschlichen Demonstrationen erlangen, warum naive Imitationen scheitern und wie moderne Algorithmen ihre Kernprobleme überwinden.

Was ist das Nachbilden?

Imitierungslernen (IL) sind eine Familie von Algorithmen, die einen Roboter dazu beibringen, durch Expertendemonstrationen zu lernen, indem er keine Belohnungsposition erfordert. Formell haben wir einen Datensatz von Demonstrationen T0, bei denen T1 der Zustand (Sensorlesungen) zu Zeit T2 und T3 ist die Handlung des Experten. Das Ziel ist es, eine Politik T4 zu lernen, die Staaten zu Aktionen abbildet.

Die Anziehungskraft von IL ist praktisch: Es ist viel einfacher für einen Menschen, einem Roboter zu zeigen, was er tun soll, als eine Belohnungsschlüsselfunktion handgebaut oder Bewegungsprimitiven zu schreiben.

Verhaltensklonung: Grundlage

Verhaltenskloning (BC) ist der einfachste IL-Algorithmus. Es behandelt das Problem als überwachtes Lernen: Angesichts des Zustands T5, prognostizieren Sie die Aktion T6. Sie trainieren ein Neuronennetzwerk, indem Sie den durchschnittlichen quadratischen Fehler zwischen prognostizierten und expertischen Aktionen über alle Demonstrationszeiten hinweg minimieren.

BC ist schnell zu trainieren, einfach zu implementieren und funktioniert überraschend gut für kurzfristige Aufgaben.

Die kritische Begrenzung: Kompozierungsfehler. Während des Trainings sieht das Netzwerk nur die in den Demonstrationen erscheinenden Zustände. Die nächste Vorhersage ist dann weniger genau, der Fehler wächst, und innerhalb weniger Sekunden befindet sich der Roboter in einem völlig ausvertriebenen Zustand, aus dem er sich nicht erholen kann.

Das Problem der Verteilungsschicht

Die Verteilung der Ausbildungsverteilung T7 (Zustände, die während der Demonstrationen gesehen werden) und die Testverteilung T8 (Zustände, die von der gelernten Politik besucht werden) sind unterschiedlich. Da BC Fehler in der Ausbildungsverteilung minimiert, gibt es keine Garantien für das Verhalten in der Testverteilung.

Die mathematische Erkenntnis: Bei einer Politik mit einem Schrittfehler T9 über einen Horizont von T10 Schritten wächst der erwartete Gesamtfehler als T11. Die Verdoppelung der Aufgabenlänge verdoppelt den Zusammenschlussfehler. Deshalb funktioniert BC für 5-Sekunden-Tätigkeiten, aber versagt es für 30-Sekunden-Tätigkeiten ohne spezielle Handhabung.

DAgger: Festsetzung der Verteilungsschicht

Die Aggregation von Datensätzen (DAgger) behandelt die Verteilungsschicht iterativ:

  • Schritt 1: Erstellen Sie eine erste BC-Politik für die ursprünglichen Demonstrationen.
  • Schritt 2: Die gelernte Politik in der realen Umgebung einführen.
  • Schritt 3: Lassen Sie einen menschlichen Experten die richtigen Maßnahmen in jedem Staat vornehmen, den die Politik besucht auch die schlechten, die sie durch Versehen erreicht hat.
  • **Stufe 4: ** Fügen Sie diese (Status, korrigierte Aktion) Paare zum Datensatz hinzu.
  • Schritt 5: Neuausbildung der Politik auf dem aggregierten Datensatz.

Nach mehreren Runden entspricht die Ausbildungsverteilung den Staaten, die die Politik tatsächlich besucht, und der Zusammenschlussfehler wird drastisch reduziert. DAgger ist theoretisch gut, aber teuer: Es erfordert eine menschliche Expertin, die während der Roboter-Exécution präsent ist, die Aktionen in Echtzeit beobachtet und korrigiert.

Moderne Algorithmen: ACT, Diffusionspolitik und IBC

Drei Algorithmen dominieren den aktuellen Stand der Technik im Bereich des Roboternimitierens.

  • ACT Action Chunking mit Transformern: Anstatt eine einzelne Aktion in jedem Schritt vorherzusagen, prognostiziert ACT einen chunk von T12 zukünftigen Aktionen auf einmal (typischerweise K=100 bei 50Hz, also 2 Sekunden Bewegung). Der Roboter führt den Teil aus, dann planet erneut. Dies bricht den Kompositionsfehlerzyklus Fehler akkumulieren sich nur innerhalb eines Teils, nicht über die ganze Episode. ACT verwendet einen CVAE-Coder für die Verarbeitung von multimodalen Demonstrationsdaten und einen Transformator-Decoder für die Erstellung von Aktionssequenzen.
  • ** Diffusionspolitik:** Modelliert die Aktionsverteilung als einen Diffusionsprozess, der denoziert. Anstatt eine einzelne Aktion vorherzusagen, lernt Diffusionspolitik, zufällige Geräusche in eine plausible Aktionsbahn iterativ zu denozieren. Dies behandelt natürlich multi-modality Fälle, in denen mehrere gültige Aktionen für einen bestimmten Zustand vorhanden sind (z.B. Ein einzelnes BC-Netzwerk würde diese Lösungen durchschnittlich durchsetzen und etwas Ungültiges vorhersagen; Diffusion Policy kann beide Modi repräsentieren.
  • IBC Implizite Verhaltensklonung: Trainiert eine Energiefunktion T13 anstatt einen direkten Aktionsvorhersager. Inferenz findet die Aktion, die Energie durch Gradient-Abstieg oder MCMC-Sampling minimiert. Robust für multimodale Verteilungen, aber berechnungsmäßig teurer zur Zeit der Abschlußfindung.

Algorithmenvergleich

Algorithm Handles Multi-Modal Action Horizon Training Speed Inference Speed Best For
Behavior Cloning No (averages modes) Single step Very fast Very fast Short tasks, simple grasps
DAgger No Single step Fast per iter Very fast Tasks where expert can correct live
ACT Partial (CVAE) Chunk (K steps) Fast Fast Bimanual, contact-rich tasks
Diffusion Policy Yes Horizon (T steps) Slow Moderate Complex, multi-modal tasks
IBC Yes Single step Moderate Slow Research; multi-modal with energy landscape

Für Anfänger: Beginnen Sie mit BC, um Ihre Datenleitung und Hardware-Setup zu validieren. Wechseln Sie zu ACT oder Diffusion Policy, wenn Sie sich mit langen Aufgaben oder Kontakt-reichen Aufgaben befassen müssen. Die Wahl zwischen ACT und Diffusion Policy hängt mehr von Ihrer Aufgabenstruktur ab als von der Rohleistung.