Diffusionspolitik für Roboterlernen: Was ist sie und wie sie verwendet wird
Was ist die Diffusionspolitik für Roboter? Erfahren Sie, wie Diffusionsmodelle Verhaltenskloning übertreffen, welche Daten Sie benötigen, wie Sie trainieren und wie RCSV-Datendienste Diffusionspolitikprojekte unterstützen.
Teil von: [Handbuch zum Nachbilden]
Die Diffusion Policy, die von Chi et al. im Jahr 2023 eingeführt wurde, brachte die generative Modellierungrevolution zur Roboterkontrolle. Durch die Behandlung von Action Generation als ein verweigerendes Problem befasst sie sich mit der multimodalen, hochdimensionalen Natur von Manipulationsverhalten auf eine Weise, die einfache Verhaltensklonungsalgorithmen nicht können. Hier ist, was Sie wissen müssen, um es für Ihr eigenes Robotikprojekt anzuwenden.
Was ist die Verbreitungspolitik?
Diffusion Policy ist eine Klasse von Roboterkontrolle-Politiken, die auf Diffusionprobability Modells (DDPMs) basiert. Ausgehend von reinem Gaussgeräusch im Aktionsraum, verweist das Modell iterativ, dass es bedingt auf der aktuellen visuellen Beobachtung und Roboterzustand, eine kohärente, hochwertige Aktionssequenz nach 10
Die wichtigste Erkenntnis ist, dass Diffusionsmodelle eine vollständige Wahrscheinlichkeitsverteilung über Handlungen lernen, anstatt eine einzige beste Handlung vorherzusagen. Für die Robotik ist dies entscheidend. Ein Modell, das diese Verteilung zu einer einzigen Vorhersage zusammenbrechen muss, wird sich entweder an einen Modus engagieren und die andere Hälfte der Zeit versagen, oder die Modus durchschnittlich durchsetzen und eine bizarre Trajektorie zwischen den beiden produzieren, die immer versagt.
Die Theorie der Abstimmung der Punkte: Wie Diffusionsmodelle Aktionen lernen
Die mathematische Grundlage der Diffusionspolitik ist das Ergebnismatching
Die Ausbildungsziele sind verblüffend einfach: ein durchschnittlicher Fehlerverlust zwischen dem vorhergesagten Lärm und dem tatsächlichen Lärm, der während des Weiterentwicklungsprozesses hinzugefügt wird.
L = E[Nährungs- und Verlaufseite - Epsilon_theta\sqrt\alpha_t) * a_0 + sqrt\1-alpha_t) * Epsilon, o, t)
Die Daten des Netzwerks werden in jedem Lärmzustand aus den Lärmverteilungen ausgleichen.
Die Beobachtung von
U-Net vs. Transformator Architekturen
Die ursprüngliche Diffusion Policy-Papier (Chi et al., 2023) bewertete zwei Bauchleibarchitekturen für das Verweigernetzwerk.
CNN U-Net Rückgrat (Verbreitungspolitik-C)
Das U-Net-Backbone behandelt die Aktionssequenz als ein 1D-Signal und verwendet eine konvolutionale Architektur mit Sprungverbindungen
- Parameter: ~25M für eine Standardkonfiguration
- Lehrzeit: 4-8 Stunden auf RTX 3090 für 200 Episoden
- Inferenz (DDPM, 100 Schritte): ~900 ms pro Aktionsstück
- Inferenz (DDIM, 10 Schritte): ~15 ms pro Aktionsstück
- ** Stärken:** Schnelle Ableitung, geringeres GPU-Speicher, gut geeignet für Ein-Task-Politiken
- Schwächen: Einschränkte Kapazität für mehrtägige oder sprachlich bedingte Einstellungen
Transformator-Rückgrat (Verbreitungspolitik-T)
Die Transformer-Backbone behandelt jeden Aktionszeitschritt als ein Token und fügt Beobachtungs-Token und Diffusionszeitschritt-Einbetten in die Sequenz hinzu.
- Parameter: ~60-100M je nach Konfiguration
- Lehrzeit: 8-16 Stunden auf RTX 3090 für 200 Episoden
- Inferenz (DDPM, 100 Schritte): ~2,5 Sekunden pro Aktionsstück
- Inferenz (DDIM, 10 Schritte): ~45 ms pro Aktionsstück
- ** Stärken:** Höhere Kapazität, bessere Multi-Task-Skalierung, die Konditionierung der natürlichen Sprache durch die Kreuz-Aufmerksamkeit
- Schwächen: Langsamere Ableitung, höherer GPU-Speicher (verlangt 16 GB+ VRAM), schwerer zu tunnen
Praktische Empfehlung: Nutzen Sie das U-Net-Backbone für Single-Task-Politiken, wo die Schnellheit der Ableitung (Echtzeitsteuerung bei 10Hz+) wichtig ist. Nutzen Sie das Transformator-Backbone für Multi-Task-Politiken, sprachlich bedingte Einstellungen oder wenn Sie über 500 Demonstrationen verfügen und die Fähigkeit haben, von einem größeren Modell zu profitieren.
Inferenzzeit: DDPM vs DDIM vs Konsistenz Destillation
Die Kosten für die Ableitung und die Zeit der Diffusion Policy sind die primäre praktische Beschränkung. Der Abzugsprozess erfordert mehrere Weitergänge durch das Netzwerk, wobei jede eine etwas geräuschlose Aktionsbahn erzeugt. Die Anzahl der Schritte bestimmt direkt sowohl die Ableitungsschwinde als auch die Aktionsqualität.
| Scheduler | Steps | Latenz (U-Net, RTX 3090) | Quality vs DDPM-100 | Notes |
|---|---|---|---|---|
| DDPM | 100 | ~900ms | Baseline (100%) | Too slow for most real-time control |
| DDIM | 25 | ~40ms | 98-99% | Good default for deployment |
| DDIM | 10 | ~15ms | 95-98% | Recommended for 10Hz+ control |
| Consistency Distillation | 1-3 | ~3-5ms | 90-95% | Best for high-frequency control, requires additional training |
Der Aktions-Chunking-Mechanismus lindert das Latenzproblem: Die Diffusion Policy prognostiziert einen Teil von 16-32 zukünftigen Aktionen in einem einzigen Denosing-Pass. Der Roboter führt die ersten 8 Aktionen vom Teil an der Steuerfrequenz (z.B. 10Hz) aus, während der nächste Teil berechnet wird. Diese überlappende Ausführung bedeutet, dass die effektive Kontrollrate durch die Ausführungszeit des Stückes begrenzt ist, nicht die Entbindungszeit
Warum die Diffusionspolitik die Standardverhaltenskloning übertrefft
Standardverhaltenskloning (BC) bildet eine Politik als ein überwachtes Regressionsproblem aus: gegebenenfalls Beobachtung, Vorhersage von Aktion. Dies funktioniert, wenn das Kartieren von Beobachtungen zu Aktionen deterministisch und unmodal ist. In der Praxis sind Manipulations Aufgaben selten. Selbst "einfache" Aufgaben wie das Abheben eines Bloks aus einem Tisch beinhalten mehrere gültige Ansatzwinkel, Greifenposen und Pre-Griffkonfigurationen. Naive BC erzeugt Richtlinien, die an Entscheidungspunkten zögern, kompromittierte Bewegungsentscheidungen treffen oder direkt scheitern, wenn sich die Testverteilung leicht von der Ausbildung unterscheidet.
Die Diffusion Policy übertrifft die BC-Basislinien bei Benchmark-Manipulation-Suiten konsequent. Bei der Bewertung von Roboter in der Realität zeigte die Diffusion Policy ein robusteres Wiederherstellungsverhalten.
Benchmark-Ergebnisse: Robomimic und RoboSuite
| Task (Robomimic) | BC (MLP) | BC-RNN | ACT | Diffusion Policy |
|---|---|---|---|---|
| Lift | 78% | 96% | 98% | 100% |
| Can | 54% | 82% | 90% | 96% |
| Square (bimanual) | 18% | 56% | 72% | 88% |
| Transport (long-horizon) | 6% | 24% | 48% | 62% |
Die Margen sind bei multimodalen Aufgaben (Fläche, Transport), bei denen mehrere gültige Strategien vorhanden sind, größer. bei einmodalen Aufgaben (Lift) ist der Vorteil kleiner, da alle Basislinien die einzige richtige Strategie finden können.
Wann man sich für eine Verbreitungspolitik oder eine Rechtsakte entscheiden kann
Im Vergleich zu ACT (Action Chunking with Transformers) funktioniert die Diffusion Policy im Allgemeinen besser bei Aufgaben mit starker Multimodalität und schlechter bei Aufgaben mit langen Horizontsabhängigkeiten, bei denen die ACT-Punkt-Vorhersage leuchtet. Hier ist ein Entscheidungsrahmen:
| Choose Diffusion Policy When | Choose ACT When |
|---|---|
| Multiple valid grasp strategies exist for each scene | Task has a single dominant strategy |
| You have 300+ demonstrations and want to leverage data scale | You have 50-150 demonstrations and need fast iteration |
| Recovery from perturbations is important | Temporal consistency over long horizons matters more |
| Control rate of 10Hz is sufficient | You need 50Hz+ control frequency |
| Single-arm manipulation with variable approach | Bimanual coordination requiring tight temporal sync |
In der Praxis sind beide Algorithmen so konkurrenzfähig, dass die Qualität und Quantität des Datensatzes mehr bedeuten als die Wahl der Richtlinienarchitektur.
Datenanforderungen für die Verbreitungspolitik
Die Diffusion Policy profitiert von mehr Daten als die ACT, vor allem weil das Entweckungsnetz mehr Parameter und ein reicheres Modellierungsziel hat. Um robuste Einsatzleistung zu erreichen
Die Datenvielfalt ist genauso wichtig wie das Volumen. Die Demonstrationen sollten die Bandbreite der Objekteposition, -orientierungen und -Szenenkonfigurationen umfassen, die Sie bei der Bereitstellung erwarten. RCSVs [Managed Data Collection Service]
Die Beobachtungsdarstellung ist auch von Bedeutung. Die Diffusion Policy mit einem End-to-End-Ausbildungskodeur von ResNet übertrifft in der Regel die Politiken mit gefrorenen vorgebildeten Encodern auf schmalen Aufgabenverteilungen, aber vorgebildete Encodern (R3M, MVP, DINO) erzeugen eine bessere Verallgemeinerung, wenn die Testbedingungen von der Ausbildung abweichen. Für die meisten praktischen Projekte beginnen Sie mit einem vorgeübten Encoder, um den Wert Ihres Datensatzes zu maximieren, und wechseln Sie nur auf End-to-End-Training, wenn Sie mehr als 500 Demonstrationen und eine stabile Umgebung haben.
Ausbildungsvorbereitung und Rechenanforderungen
Die Referenzimplementierung der Diffusion Policy (besorgt im Columbia Robotics Lab GitHub) ist entweder mit einem UNet-Backbone (schnellerer Ableitung, niedrigerer Kapazität) oder einem Transformer-Backbone (langsamer Ableitung, höhere Kapazität) ausgestattet. Die Ausbildung auf einem einzelnen RTX 3090 oder 4090 dauert für einen 200-Episoden-Datensatz 4 bis 12 Stunden, je nach Auflösung der Beobachtung und der Länge des Aktionshorizonts.
Schlüsselhyperparameter, die korrekt eingestellt werden müssen: der Aktionshorizont (wie viele zukünftige Schritte zu prognostizieren
Schnellstart-Trainingsbefehle
# Klonen der Referenzimplementierung git clone
Für die Ableitung auf einem echten Roboter ist DDPM bei 100 Schritten typischerweise zu langsam für die Hochfrequenzsteuerung. Verwenden Sie den DDIM-Scheduler mit 10-25 Schritten, der bei ~20Hz auf einem RTX 3090
Nutzung von RCSV-Datendiensten für die Diffusionspolitik
Die [Datendienstleistungspipeline] von RCSV erzeugt Datenmengen, die für die direkte Nutzung mit der Implementierung der Diffusion Policy-Referenz und dem HuggingFace LeRobot-Framework formatiert sind. Qualitätsfilterung entfernt Episoden, bei denen die Aufgabe nicht erfolgreich ausgeführt wurde, der Roboter mit der Umwelt kollidierte oder der Betreiber mit Zögern nicht repräsentative Flugbahnen erzeugte.
Unser Sammeldienst verwendet die [RCSV-Telebetriebsplattform]
Teams, die mit den [OpenArm 1]
Verwandte Lesungen
- VLA-Modelle erklärt -- Wann VLAs anstelle von Diffusionsrichtlinien verwendet werden
- ALOHA Robot Guide -- ACT vs Diffusion Policy auf ALOHA-Hardware
- [Was sind Roboter-Schuldaten?]
T10 ) -- Datenqualitätsstandards für die Politikbildung - RoboterdatenAnnotation -- Kennzeichnung für Datenmengen der Verbreitungspolitik
- RCSV-Datendienste -- Datensätze im ZARR-Format für die Diffusionpolitik
- Public Datasets -- Bereit-zu-trainierende Manipulationsdatensätze
- [Benchmarks]
T14 ) -- Vergleichen Sie die politische Leistung zwischen den Aufgaben







