Zurück zu Blog

Diffusionspolitik für Roboterlernen: Was ist sie und wie sie verwendet wird

Was ist die Diffusionspolitik für Roboter? Erfahren Sie, wie Diffusionsmodelle Verhaltenskloning übertreffen, welche Daten Sie benötigen, wie Sie trainieren und wie RCSV-Datendienste Diffusionspolitikprojekte unterstützen.

Teil von: [Handbuch zum Nachbilden]

Die Diffusion Policy, die von Chi et al. im Jahr 2023 eingeführt wurde, brachte die generative Modellierungrevolution zur Roboterkontrolle. Durch die Behandlung von Action Generation als ein verweigerendes Problem befasst sie sich mit der multimodalen, hochdimensionalen Natur von Manipulationsverhalten auf eine Weise, die einfache Verhaltensklonungsalgorithmen nicht können. Hier ist, was Sie wissen müssen, um es für Ihr eigenes Robotikprojekt anzuwenden.

Was ist die Verbreitungspolitik?

Diffusion Policy ist eine Klasse von Roboterkontrolle-Politiken, die auf Diffusionprobability Modells (DDPMs) basiert. Ausgehend von reinem Gaussgeräusch im Aktionsraum, verweist das Modell iterativ, dass es bedingt auf der aktuellen visuellen Beobachtung und Roboterzustand, eine kohärente, hochwertige Aktionssequenz nach 10100 verweist Schritte produziert.

Die wichtigste Erkenntnis ist, dass Diffusionsmodelle eine vollständige Wahrscheinlichkeitsverteilung über Handlungen lernen, anstatt eine einzige beste Handlung vorherzusagen. Für die Robotik ist dies entscheidend. Ein Modell, das diese Verteilung zu einer einzigen Vorhersage zusammenbrechen muss, wird sich entweder an einen Modus engagieren und die andere Hälfte der Zeit versagen, oder die Modus durchschnittlich durchsetzen und eine bizarre Trajektorie zwischen den beiden produzieren, die immer versagt.

Die Theorie der Abstimmung der Punkte: Wie Diffusionsmodelle Aktionen lernen

Die mathematische Grundlage der Diffusionspolitik ist das Ergebnismatching Lernen des Gradients der Log-Wahrscheinlichkeitsdichte der Datenverteilung. Im Weiterprozess wird Gauss-Läusch nach und nach nach einer Variationszeit nach einem T-Zeitrahmen aus dem Demonstrationsdatensatz zu Aktionsbahnen hinzugefügt. Das neuronale Netzwerk ist darauf ausgerichtet, diesen Prozess umzukehren: Angesichts einer lauten Aktionsbahn und der aktuellen Beobachtung können die hinzugefügten Geräusche (oder gleichwertig die "Score" den Gradient der Logdichte) vorhergesagt werden.

Die Ausbildungsziele sind verblüffend einfach: ein durchschnittlicher Fehlerverlust zwischen dem vorhergesagten Lärm und dem tatsächlichen Lärm, der während des Weiterentwicklungsprozesses hinzugefügt wird.

L = E[Nährungs- und Verlaufseite - Epsilon_theta\sqrt\alpha_t) * a_0 + sqrt\1-alpha_t) * Epsilon, o, t)

Die Daten des Netzwerks werden in jedem Lärmzustand aus den Lärmverteilungen ausgleichen.

Die Beobachtung von typischerweise Bildmerkmale aus einem CNN- oder ViT-Encoder, plus proprioceptive Zustand verzerrt die Verleugnung in Richtung von Aktionsbahnen, die für die aktuelle Szene geeignet sind. Das gleiche Denosing-Netzwerk kann für verschiedene Beobachtungen radikal unterschiedliche Bahnen erzeugen, da die Beobachtungsmerkmale den Denosing-Prozess durch verschiedene Regionen der erlernten Aktionsverteilung lenken.

U-Net vs. Transformator Architekturen

Die ursprüngliche Diffusion Policy-Papier (Chi et al., 2023) bewertete zwei Bauchleibarchitekturen für das Verweigernetzwerk.

CNN U-Net Rückgrat (Verbreitungspolitik-C)

Das U-Net-Backbone behandelt die Aktionssequenz als ein 1D-Signal und verwendet eine konvolutionale Architektur mit Sprungverbindungen die gleiche Struktur, die in Bilddiffusionsmodellen verwendet wird, aber auf zeitlichen und nicht räumlichen Dimensionen arbeitet.

  • Parameter: ~25M für eine Standardkonfiguration
  • Lehrzeit: 4-8 Stunden auf RTX 3090 für 200 Episoden
  • Inferenz (DDPM, 100 Schritte): ~900 ms pro Aktionsstück
  • Inferenz (DDIM, 10 Schritte): ~15 ms pro Aktionsstück
  • ** Stärken:** Schnelle Ableitung, geringeres GPU-Speicher, gut geeignet für Ein-Task-Politiken
  • Schwächen: Einschränkte Kapazität für mehrtägige oder sprachlich bedingte Einstellungen

Transformator-Rückgrat (Verbreitungspolitik-T)

Die Transformer-Backbone behandelt jeden Aktionszeitschritt als ein Token und fügt Beobachtungs-Token und Diffusionszeitschritt-Einbetten in die Sequenz hinzu.

  • Parameter: ~60-100M je nach Konfiguration
  • Lehrzeit: 8-16 Stunden auf RTX 3090 für 200 Episoden
  • Inferenz (DDPM, 100 Schritte): ~2,5 Sekunden pro Aktionsstück
  • Inferenz (DDIM, 10 Schritte): ~45 ms pro Aktionsstück
  • ** Stärken:** Höhere Kapazität, bessere Multi-Task-Skalierung, die Konditionierung der natürlichen Sprache durch die Kreuz-Aufmerksamkeit
  • Schwächen: Langsamere Ableitung, höherer GPU-Speicher (verlangt 16 GB+ VRAM), schwerer zu tunnen

Prakti­sche Empfehlung: Nutzen Sie das U-Net-Backbone für Single-Task-Politiken, wo die Schnellheit der Ableitung (Echtzeitsteuerung bei 10Hz+) wichtig ist. Nutzen Sie das Transformator-Backbone für Multi-Task-Politiken, sprachlich bedingte Einstellungen oder wenn Sie über 500 Demonstrationen verfügen und die Fähigkeit haben, von einem größeren Modell zu profitieren.

Inferenzzeit: DDPM vs DDIM vs Konsistenz Destillation

Die Kosten für die Ableitung und die Zeit der Diffusion Policy sind die primäre praktische Beschränkung. Der Abzugsprozess erfordert mehrere Weitergänge durch das Netzwerk, wobei jede eine etwas geräuschlose Aktionsbahn erzeugt. Die Anzahl der Schritte bestimmt direkt sowohl die Ableitungsschwinde als auch die Aktionsqualität.

Scheduler Steps Latenz (U-Net, RTX 3090) Quality vs DDPM-100 Notes
DDPM 100 ~900ms Baseline (100%) Too slow for most real-time control
DDIM 25 ~40ms 98-99% Good default for deployment
DDIM 10 ~15ms 95-98% Recommended for 10Hz+ control
Consistency Distillation 1-3 ~3-5ms 90-95% Best for high-frequency control, requires additional training

Der Aktions-Chunking-Mechanismus lindert das Latenzproblem: Die Diffusion Policy prognostiziert einen Teil von 16-32 zukünftigen Aktionen in einem einzigen Denosing-Pass. Der Roboter führt die ersten 8 Aktionen vom Teil an der Steuerfrequenz (z.B. 10Hz) aus, während der nächste Teil berechnet wird. Diese überlappende Ausführung bedeutet, dass die effektive Kontrollrate durch die Ausführungszeit des Stückes begrenzt ist, nicht die Entbindungszeit , solange die Entbindung abgeschlossen ist, bevor der aktuelle Stück ausgeht.

Warum die Diffusionspolitik die Standardverhaltenskloning übertrefft

Standardverhaltenskloning (BC) bildet eine Politik als ein überwachtes Regressionsproblem aus: gegebenenfalls Beobachtung, Vorhersage von Aktion. Dies funktioniert, wenn das Kartieren von Beobachtungen zu Aktionen deterministisch und unmodal ist. In der Praxis sind Manipulations Aufgaben selten. Selbst "einfache" Aufgaben wie das Abheben eines Bloks aus einem Tisch beinhalten mehrere gültige Ansatzwinkel, Greifenposen und Pre-Griffkonfigurationen. Naive BC erzeugt Richtlinien, die an Entscheidungspunkten zögern, kompromittierte Bewegungsentscheidungen treffen oder direkt scheitern, wenn sich die Testverteilung leicht von der Ausbildung unterscheidet.

Die Diffusion Policy übertrifft die BC-Basislinien bei Benchmark-Manipulation-Suiten konsequent. Bei der Bewertung von Roboter in der Realität zeigte die Diffusion Policy ein robusteres Wiederherstellungsverhalten.

Benchmark-Ergebnisse: Robomimic und RoboSuite

Task (Robomimic) BC (MLP) BC-RNN ACT Diffusion Policy
Lift 78% 96% 98% 100%
Can 54% 82% 90% 96%
Square (bimanual) 18% 56% 72% 88%
Transport (long-horizon) 6% 24% 48% 62%

Die Margen sind bei multimodalen Aufgaben (Fläche, Transport), bei denen mehrere gültige Strategien vorhanden sind, größer. bei einmodalen Aufgaben (Lift) ist der Vorteil kleiner, da alle Basislinien die einzige richtige Strategie finden können.

Wann man sich für eine Verbreitungspolitik oder eine Rechtsakte entscheiden kann

Im Vergleich zu ACT (Action Chunking with Transformers) funktioniert die Diffusion Policy im Allgemeinen besser bei Aufgaben mit starker Multimodalität und schlechter bei Aufgaben mit langen Horizontsabhängigkeiten, bei denen die ACT-Punkt-Vorhersage leuchtet. Hier ist ein Entscheidungsrahmen:

Choose Diffusion Policy When Choose ACT When
Multiple valid grasp strategies exist for each scene Task has a single dominant strategy
You have 300+ demonstrations and want to leverage data scale You have 50-150 demonstrations and need fast iteration
Recovery from perturbations is important Temporal consistency over long horizons matters more
Control rate of 10Hz is sufficient You need 50Hz+ control frequency
Single-arm manipulation with variable approach Bimanual coordination requiring tight temporal sync

In der Praxis sind beide Algorithmen so konkurrenzfähig, dass die Qualität und Quantität des Datensatzes mehr bedeuten als die Wahl der Richtlinienarchitektur.

Datenanforderungen für die Verbreitungspolitik

Die Diffusion Policy profitiert von mehr Daten als die ACT, vor allem weil das Entweckungsnetz mehr Parameter und ein reicheres Modellierungsziel hat. Um robuste Einsatzleistung zu erreichen Handhabung von Objektpositionsauswiedergang, Lichtveränderungen und gelegentlichen Sensorlärm Budget 300-500 Demonstrationen pro Aufgabe. Im Gegensatz zu ACT verbessert sich die Diffusion Policy mit zusätzlichen Daten bis zu ziemlich großen Datensätzen weiter, was sie zu einer besseren Wahl macht, wenn Sie planen, in eine groß angelegte Datenerhebung zu investieren.

Die Datenvielfalt ist genauso wichtig wie das Volumen. Die Demonstrationen sollten die Bandbreite der Objekteposition, -orientierungen und -Szenenkonfigurationen umfassen, die Sie bei der Bereitstellung erwarten. RCSVs [Managed Data Collection Service] T1) folgt strukturierten Variationsprotokollen systematisch randomisieren Objektpositionen, Lichtbedingungen und Operator-Griffstile , um Datensätze zu gewährleisten, die verallgemeinbare Richtlinien erzeugen.

Die Beobachtungsdarstellung ist auch von Bedeutung. Die Diffusion Policy mit einem End-to-End-Ausbildungskodeur von ResNet übertrifft in der Regel die Politiken mit gefrorenen vorgebildeten Encodern auf schmalen Aufgabenverteilungen, aber vorgebildete Encodern (R3M, MVP, DINO) erzeugen eine bessere Verallgemeinerung, wenn die Testbedingungen von der Ausbildung abweichen. Für die meisten praktischen Projekte beginnen Sie mit einem vorgeübten Encoder, um den Wert Ihres Datensatzes zu maximieren, und wechseln Sie nur auf End-to-End-Training, wenn Sie mehr als 500 Demonstrationen und eine stabile Umgebung haben.

Ausbildungsvorbereitung und Rechenanforderungen

Die Referenzimplementierung der Diffusion Policy (besorgt im Columbia Robotics Lab GitHub) ist entweder mit einem UNet-Backbone (schnellerer Ableitung, niedrigerer Kapazität) oder einem Transformer-Backbone (langsamer Ableitung, höhere Kapazität) ausgestattet. Die Ausbildung auf einem einzelnen RTX 3090 oder 4090 dauert für einen 200-Episoden-Datensatz 4 bis 12 Stunden, je nach Auflösung der Beobachtung und der Länge des Aktionshorizonts.

Schlüsselhyperparameter, die korrekt eingestellt werden müssen: der Aktionshorizont (wie viele zukünftige Schritte zu prognostizieren in der Regel 16-32 für Tabelle Aufgaben), die Anzahl der Diffusionsschritte (100 für DDPM, 10-25 für DDIM mit minimalem Qualitätsverlust) und das Beobachtungsfenster (wie viele vergangene Rahmen, die in der Regel 2 enthalten). Ändern Sie nicht alle drei gleichzeitig; bearbeiten Sie die anderen beim Tuning eines. Die beeinflussteste Veränderung zur Verbesserung der Politikleistung ist in der Regel die Erhöhung der Datensatzgröße, nicht die Anpassung von Architekturhyperparametern.

Schnellstart-Trainingsbefehle

# Klonen der Referenzimplementierung git clone T15 cd diffusion_policy pip installation -e . # Train U-Net Variante auf Ihrem Datensatz (ZARR-Format) python train.py --config-dir=. --config-name=image_pusht_diffusion_policy_cnn \ task.datensatz_path=/path/to/your/datensatz.zarr \ training.num_epochs=3000 \ policy.noise_scheduler.num_train_timesteps= \ policy.horizon=16 \ policy.n_obs_steps=2 # Evaluate with DDIM inference evaluler.py_conalu=. --configure-name=\no_figure_policy\\n_disfusion\n_disc_policy\\squiz_squiz_squiz_squiz_squiz_squiz_squiz_squiz_squiz_squiz_squiz_squiz_squiz_squiz_squiz_squiz_squiz_squiz_squiz_squiz_squiz_squiz_squiz_squiz_squiz_squiz_squiz_squiz_squ_squ_squ_squ_squ_squ_squ_squ_squ_squ_squ_squ_squ_squ_squ_squ_squ_squ_s

Für die Ableitung auf einem echten Roboter ist DDPM bei 100 Schritten typischerweise zu langsam für die Hochfrequenzsteuerung. Verwenden Sie den DDIM-Scheduler mit 10-25 Schritten, der bei ~20Hz auf einem RTX 3090 läuft, der für die 10Hz-Steuerung mit einem Puffer ausreichend ist. Alternativ kann die Konsistenzpolitik destillation 1-3 Schritten Ableitung mit minimalem Leistungsverlust für einfachere Aufgaben erreichen.

Nutzung von RCSV-Datendiensten für die Diffusionspolitik

Die [Datendienstleistungspipeline] von RCSV erzeugt Datenmengen, die für die direkte Nutzung mit der Implementierung der Diffusion Policy-Referenz und dem HuggingFace LeRobot-Framework formatiert sind. Qualitätsfilterung entfernt Episoden, bei denen die Aufgabe nicht erfolgreich ausgeführt wurde, der Roboter mit der Umwelt kollidierte oder der Betreiber mit Zögern nicht repräsentative Flugbahnen erzeugte.

Unser Sammeldienst verwendet die [RCSV-Telebetriebsplattform]T3) mit doppelter Arm- und Führungskräfte, Handgelenk- und Oberkameras und optionalem Kraft-Torque-Logging. Für die Ausbildung der Multi-Task-Difusion-Politik , bei der eine einzige Politik mehrere Aufgaben lernt, die auf Task-ID oder Sprache abhängen können wir innerhalb derselben Kampagne verschiedene Aufgabenvarianten sammeln und einen einheitlichen Datensatz liefern. Pilotprogramme beginnen bei 2.500 USD für 200 Demonstrationen; komplette Kampagnen für 500+ Demonstrationen beginnen bei 8.000 USD.

Teams, die mit den [OpenArm 1]T4) ($4.500) oder [ALOHA]T5) Hardware-Plattformen arbeiten, erhalten native Hardware-Unterstützung; maßgeschneiderte Hardware-Integration ist auf Anfrage verfügbar. Für Teams, die die Diffusion Policy vor der Investition in die Datenerhebung bewerten möchten, umfassen unsere [öffentliche Datensätze]T6) mehrere hundert Episoden-Manipulationsdatenmengen im ZARR-Format, die für die Ausbildung bereit sind. [Kontaktieren Sie unser Team]T7) um Ihre Datenanforderungen und Zeitplan zu besprechen.

Verwandte Lesungen

  • VLA-Modelle erklärt -- Wann VLAs anstelle von Diffusionsrichtlinien verwendet werden
  • ALOHA Robot Guide -- ACT vs Diffusion Policy auf ALOHA-Hardware
  • [Was sind Roboter-Schuldaten?] T10) -- Datenqualitätsstandards für die Politikbildung
  • RoboterdatenAnnotation -- Kennzeichnung für Datenmengen der Verbreitungspolitik
  • RCSV-Datendienste -- Datensätze im ZARR-Format für die Diffusionpolitik
  • Public Datasets -- Bereit-zu-trainierende Manipulationsdatensätze
  • [Benchmarks]T14) -- Vergleichen Sie die politische Leistung zwischen den Aufgaben