Roboter lernen, wie sie sich imitieren: Von Verhaltensklonung bis zu Verbreitungspolitik
Eine klare Einführung in das Imitationslernen <unk> Verhaltensklonung, Verteilungsschicht, DAgger, Action Chunking und Diffusionspolitik erklärt.
[← Lernen]
Erfahren Sie, wie Roboter Fähigkeiten aus menschlichen Demonstrationen erlangen, warum naive Imitationen scheitern und wie moderne Algorithmen ihre Kernprobleme überwinden.
Was ist das Nachbilden?
Imitierungslernen (IL) sind eine Familie von Algorithmen, die einen Roboter dazu beibringen, durch Expertendemonstrationen zu lernen, indem er keine Belohnungsposition erfordert. Formell haben wir einen Datensatz von Demonstrationen
Die Anziehungskraft von IL ist praktisch: Es ist viel einfacher für einen Menschen, einem Roboter zu zeigen, was er tun soll, als eine Belohnungsschlüsselfunktion handgebaut oder Bewegungsprimitiven zu schreiben.
Verhaltensklonung: Grundlage
Verhaltenskloning (BC) ist der einfachste IL-Algorithmus. Es behandelt das Problem als überwachtes Lernen: Angesichts des Zustands
BC ist schnell zu trainieren, einfach zu implementieren und funktioniert überraschend gut für kurzfristige Aufgaben.
Die kritische Begrenzung: Kompozierungsfehler. Während des Trainings sieht das Netzwerk nur die in den Demonstrationen erscheinenden Zustände. Die nächste Vorhersage ist dann weniger genau, der Fehler wächst, und innerhalb weniger Sekunden befindet sich der Roboter in einem völlig ausvertriebenen Zustand, aus dem er sich nicht erholen kann.
Das Problem der Verteilungsschicht
Die Verteilung der Ausbildungsverteilung
Die mathematische Erkenntnis: Bei einer Politik mit einem Schrittfehler
DAgger: Festsetzung der Verteilungsschicht
Die Aggregation von Datensätzen (DAgger) behandelt die Verteilungsschicht iterativ:
- Schritt 1: Erstellen Sie eine erste BC-Politik für die ursprünglichen Demonstrationen.
- Schritt 2: Die gelernte Politik in der realen Umgebung einführen.
- Schritt 3: Lassen Sie einen menschlichen Experten die richtigen Maßnahmen in jedem Staat vornehmen, den die Politik besucht
auch die schlechten, die sie durch Versehen erreicht hat. - **Stufe 4: ** Fügen Sie diese (Status, korrigierte Aktion) Paare zum Datensatz hinzu.
- Schritt 5: Neuausbildung der Politik auf dem aggregierten Datensatz.
Nach mehreren Runden entspricht die Ausbildungsverteilung den Staaten, die die Politik tatsächlich besucht, und der Zusammenschlussfehler wird drastisch reduziert. DAgger ist theoretisch gut, aber teuer: Es erfordert eine menschliche Expertin, die während der Roboter-Exécution präsent ist, die Aktionen in Echtzeit beobachtet und korrigiert.
Moderne Algorithmen: ACT, Diffusionspolitik und IBC
Drei Algorithmen dominieren den aktuellen Stand der Technik im Bereich des Roboternimitierens.
- ACT
Action Chunking mit Transformern: Anstatt eine einzelne Aktion in jedem Schritt vorherzusagen, prognostiziert ACT einen chunk vonT12 zukünftigen Aktionen auf einmal (typischerweise K=100 bei 50Hz, also 2 Sekunden Bewegung). Der Roboter führt den Teil aus, dann planet erneut. Dies bricht den Kompositionsfehlerzyklus Fehler akkumulieren sich nur innerhalb eines Teils, nicht über die ganze Episode. ACT verwendet einen CVAE-Coder für die Verarbeitung von multimodalen Demonstrationsdaten und einen Transformator-Decoder für die Erstellung von Aktionssequenzen. - ** Diffusionspolitik:** Modelliert die Aktionsverteilung als einen Diffusionsprozess, der denoziert. Anstatt eine einzelne Aktion vorherzusagen, lernt Diffusionspolitik, zufällige Geräusche in eine plausible Aktionsbahn iterativ zu denozieren. Dies behandelt natürlich multi-modality
Fälle, in denen mehrere gültige Aktionen für einen bestimmten Zustand vorhanden sind (z.B. Ein einzelnes BC-Netzwerk würde diese Lösungen durchschnittlich durchsetzen und etwas Ungültiges vorhersagen; Diffusion Policy kann beide Modi repräsentieren. - IBC
Implizite Verhaltensklonung: Trainiert eine EnergiefunktionT13 anstatt einen direkten Aktionsvorhersager. Inferenz findet die Aktion, die Energie durch Gradient-Abstieg oder MCMC-Sampling minimiert. Robust für multimodale Verteilungen, aber berechnungsmäßig teurer zur Zeit der Abschlußfindung.
Algorithmenvergleich
| Algorithm | Handles Multi-Modal | Action Horizon | Training Speed | Inference Speed | Best For |
|---|---|---|---|---|---|
| Behavior Cloning | No (averages modes) | Single step | Very fast | Very fast | Short tasks, simple grasps |
| DAgger | No | Single step | Fast per iter | Very fast | Tasks where expert can correct live |
| ACT | Partial (CVAE) | Chunk (K steps) | Fast | Fast | Bimanual, contact-rich tasks |
| Diffusion Policy | Yes | Horizon (T steps) | Slow | Moderate | Complex, multi-modal tasks |
| IBC | Yes | Single step | Moderate | Slow | Research; multi-modal with energy landscape |
Für Anfänger: Beginnen Sie mit BC, um Ihre Datenleitung und Hardware-Setup zu validieren. Wechseln Sie zu ACT oder Diffusion Policy, wenn Sie sich mit langen Aufgaben oder Kontakt-reichen Aufgaben befassen müssen. Die Wahl zwischen ACT und Diffusion Policy hängt mehr von Ihrer Aufgabenstruktur ab als von der Rohleistung.







