Zurück zu Blog

Diffusionspolitik für Roboterlernen: Wie funktioniert sie und wann sie verwendet werden (2026)

Diffusion Policy für Robotermanipulation: Wie denoisieren Aktionen vorhersagt, CNN vs Transformer, und wann es ACT und Verhaltenskloning übertrifft. 2026 Guide.

Die Diffusionspolitik ist der führende Imitationslernalgorithmus für kontaktreiche und geschickte Robotermanipulationsaufgaben. Es übertrifft konsequent die Standardverhaltenskloning und schlägt oft ACT bei Aufgaben mit multimodalen Demonstrationen. Dieser Leitfaden erklärt, wie es funktioniert, wie es mit ACT und BC verglichen wird, welche Hyperparameter am wichtigsten sind und mit welcher Hardware es bei RCSV gekoppelt werden soll.

Was ist die Verbreitungspolitik?

Die Diffusionspolitik, die von Chi et al. an der Columbia University im Jahr 2023 eingeführt wurde, wendet den Score-Matching-Framework von Bildgenerierung-Difusion-Modellen (DDPM, DDIM) auf Roboter-Aktionsvorhersage an. Anstatt eine einzelne nächste Aktion oder eine kurze Aktionssequenz aus einer Beobachtung zu prognostizieren, lernt die Politik, eine zufällige Aktionsbahn in einen kohärenten, hochwertigen Bewegungsplan iterativ zu verweisen. Das Ergebnis ist eine Handlungspolitik, die in der Praxis deutlich besser mit der multimodalen Natur menschlicher Demonstrationsdaten umgeht als die klassische Verhaltensklonung.

Die Kerninsigne ist einfach: Wenn Sie Roboterdemonstrationen von menschlichen Operatoren sammeln, erfüllen verschiedene Operatoren oft die gleiche Aufgabe qualitativ unterschiedlich sie können sich einem Objekt von links oder rechts nähern, vor dem Ziehen schieben oder von oben gegen die Seite greifen. Ein mit mittlerem Quadratfehler ausgebildetes Standardverhaltensklonungsmodell wird in diesen Modi durchschnittlich ein Handeln erzeugen, das "zwischen" zwei gültigen Verhaltensweisen liegt, das typischerweise selbst ungültig ist.

Die Arbeit zeigte eine Diffusionspolitik für 12 simulierte und reale Roboter-Manipulationsaufgaben und erzielte auf 11 von ihnen hochmoderne Ergebnisse.

Wie die Verbreitungspolitik funktioniert

Die Ausbildung und die Ableitung für die Diffusionspolitik folgen dem Standard-DDPM-Denkungsrahmen, der an Handlungsschritte anstelle von Bildern angepasst ist.

Ausbildung

Während des Trainings wird eine saubere Aktionsbahn T0 (aus dem Demonstrationsdatensatz geprobeert) durch Hinzufügen von Gauss-Läuschen über T-Zeitstufen (typischerweise T=100) nach einem Lärmplan schrittweise korrumpiert. Das neuronale Netzwerk entweder ein 1D-Zeit-CNN oder ein Transformator ist geschult, um den Lärm vorherzusagen, der bei jedem Schritt hinzugefügt wurde, angesichts der lauten Aktion, des denoisierenden Schrittindex und der aktuellen Roboterbeobachtung (Bild + proprioception). Das Netzwerk lernt, aus (Lärm, Zeitschritt, Beobachtung) → vorhergesagtem Lärm zu kartografieren, und die MSE zwischen vorhergesagtem und wahrem Lärm wird in allen Trainingspaaren minimiert.

Inferenz

Bei der Ableitung beginnt das Modell mit einem reinen Lärmvektor der gleichen Dimensionalität wie eine Aktionssequenz. Es führt dann K-Dennosing-Schritte (typischerweise K=10 für DDIM, K=100 für DDPM) jeden Schritt, der das neuronale Netzwerk aufruft, um die Lärmkomponente vorherzusagen und abzuziehen, die durch die aktuelle Beobachtung geleitet wird. Nach K-Schritten ist das Ergebnis eine komplette Aktionssequenz (typischerweise 1632 Schritte voran bei 10Hz oder 50100 Schritte bei 50Hz), die eine plausible, reibungslose Fortsetzung des aktuellen Zustands darstellt.

Die Beobachtungskonditionierung ist die wichtigste architektonische Wahl.

  • CNN-basierte (DP-C): Ein ResNet-18 oder ResNet-34-Spielraum kodiert Bildbeobachtungen in einen Feature-Vektor, der dann mit proprioceptive Zustand verschmolzen und verwendet wird, um den denodierende CNN zu konditionieren. Schneller zu trainieren und zu schließen; besser für Einzelschaltungen.
  • Transformatorbasiert (DP-T): Ein Transformator im ViT-Stil kodiert Bildtoken und verschmilzt sie mit proprioception Token.

Abläuferung der Horizontkontrolle

Eine kritische Implementierungsdetail: Die Diffusionspolitik verwendet einen Abstandshorizontansatz. Die Politik prognostiziert eine Aktionssequenz von Tp Länge (z.B. 16 Schritte), führt aber nur die ersten Ta Schritte (z.B. 8 Schritte) vor der Neuplanung aus. Dies schafft ein Gleichgewicht zwischen zeitlicher Konsistenz ( längere Tp = glattere Bewegungen) und Reaktivität (kurzer Ta = schnellere Reaktion auf unerwartete Veränderungen). Das Verhältnis Tp/Ta = 2 ist standardmäßig und funktioniert gut für die meisten Manipulationsarbeiten.

Diffusionspolitik gegenüber ACT: Ein praktischer Vergleich

Property Diffusion Policy ACT (Action Chunking Transformers)
Multimodal action distributions Excellent — models full distribution Good — CVAE captures variance but can mode-average
Inference latency (RTX 3090) 40–120ms (DDIM K=10 to K=100) ~10ms (single forward pass)
Training time (50 demos, RTX 3090) 4–8 hours (CNN), 8–16 hours (Transformer) 2–4 hours
Temporal consistency High — denoising produces smooth trajectories High — action chunking provides consistency
Bimanual coordination Good with transformer variant Excellent — natively designed for ALOHA bimanual
Dexterous hand control (20+ DOF) Excellent — handles high-dim action spaces well Moderate — chunk size tuning needed for high DOF
Open-source reference implementation Yes — diffusion_policy repo (Columbia) Yes — act repo (Stanford)
LeRobot integration Yes — native support Yes — native support

Der Überschriftvergleich: ACT ist schneller bei der Abschlussung und leichter zu trainieren, was es für zeitkritische Systeme und Teams mit begrenztem Rechenwert besser macht. In der Praxis ist die Leistung für die meisten Aufgaben der Tabelle-Manipulation mit 50200 sauberen Demonstrationen vergleichbar. Wählen Sie die Diffusionspolitik, wenn Ihre Demonstrationen natürlich variiert sind oder Ihr Aktionsraum 14 DOF übersteigt. Siehe unseren [ACT-Politik-Leitfaden]T10) für ein tieferes Eintauchen in die spezifische ACT-Austimmung.

Diffusionspolitik vs. Standardverhaltenskloning

Standardverhaltensklonung (BC) minimiert die MSE zwischen vorhergesagten und demonstrierten Aktionen. Dies funktioniert, wenn der Demonstrationsdatensatz einmodal ist wenn jeder Betreiber die Aufgabe auf die gleiche Weise erfüllt. Das Problem ist, dass menschliche Demonstrationen fast nie sind. Wenn eine BC-Politik eine Beobachtung sieht, die in Demonstrationen mit zwei verschiedenen nachfolgenden Aktionen erschien, durchschnittst sie, was in beiden Fällen eine falsche Bewegung erzeugt.

Die Diffusionspolitik vermeidet Modus-Durchschnitt, weil sie die gesamte bedingte Verteilung p Action Beobachtung modelliert und nicht nur die bedingte Mittel E Action Beobachtung. Deshalb zeigte das ursprüngliche Papier die größten Verbesserungen gegenüber BC bei Aufgaben mit der höchsten Demonstrationsvarianz: die Schieben-Tasche (Block von verschiedenen Winkeln durch die Betreiber) und die zweimanschließende Verteilung (Block von verschiedenen Koordinierungsstrategien).

Wenn Ihre Aufgabe in den gezeigten Bahnen weniger als 5% abweicht (d.h. alle Betreiber tun genau das gleiche), kann BC mit einem guten Rückgrat die Diffusionspolitik entsprechen.

Wann eine Verbreitungspolitik zu wählen ist

Wählen Sie die Diffusionsrichtlinie, wenn:

  • Ihre Demonstrationen sind multimodal. Wenn verschiedene Betreiber die Aufgabe mit bedeutungsvollen unterschiedlichen Bewegungssätzen erfüllen, verarbeitet die Diffusionspolitik dies besser als ACT oder BC.
  • Ein hoher DOF-Aktionsraum ist vorhanden. Dexterose Hände (1620+ DOF) profitieren mehr von der Fähigkeit der Diffusionspolitik, gemeinsame Korrelationen über die volle Aktionsdimension zu modellieren als der feststeckende, stückbasierte Ansatz von ACT.
  • Sie benötigen eine genaue Positionierung der Endpunkte. Das Originalpapier zeigte, dass die Diffusionspolitik aufgrund der iterativen Verfeinerung beim Entzünden eine Präzisions-Einsetzen-Genauigkeit von unter 2 mm erreicht.
  • Sie vergleichen die veröffentlichten Ergebnisse. Viele jüngste Arbeiten (20242026) berichten über die Diffusionspolitik als Ausgangslinie.
  • Sie haben mehr GPU-Budget für das Training. Wenn Sie mehrere GPUs haben, parallelisiert sich die Ausbildungspolitik für Diffusion gut und die Transformatorvariante erzielt bessere Ergebnisse mit mehr Rechenleistung.

Wählen Sie ACT Wenn:

  • Die Latenz der Inferenz ist kritisch. ACT kann bei 10 ms pro Inferenzschritt bei 100 Hz auf bescheidener Hardware laufen.
  • Sie arbeiten mit ALOHA-Format-Bimanual-Daten. ACT wurde für ALOHA entwickelt und die Referenzimplementierung erfordert keine Formatkonvertierung.
  • Behandlung ist begrenzt. Ein 2-stündiges ACT-Training läuft gegenüber 48 Stunden für Fragen der Diffusionpolitik, wenn Sie schnell auf die Aufgabenentwicklung iterieren.
  • Sie entsprechen einem bestimmten vorherigen Ergebnis. Wenn Sie die ACT-Zahlen von Stanford genau reproduzieren müssen, verwenden Sie ACT.

Schlüssel-Hyperparameter für die Diffusionspolitik

Dies sind die Parameter, die die Nadel in der Praxis tatsächlich bewegen, in grob abnehmender Bedeutung:

Parameter Default Effect of Increasing
pred_horizon (Tp) 16 Smoother trajectories; slower re-planning; more memory
action_horizon (Ta) 8 Fewer inference calls; less reactive to perturbations
obs_horizon 2 More temporal context; helps with tasks requiring memory of recent motion
num_diffusion_iters (K) 10 (DDIM), 100 (DDPM) Higher quality actions; slower inference
noise_scheduler DDIM DDPM is higher quality but 10x slower; DDIM preferred for real-time use
vision_encoder ResNet-18 ResNet-34 / ViT improves performance; requires more compute
n_obs_steps 2 Stacking more observation frames helps tasks with motion-based cues (sliding, rotating)

Der häufigste Fehler: Die Einstellung von T8 zu lang und T9 zu kurz. Dies erzeugt Richtlinien, die sich zu einer geplanten Flugbahn überfordern und nicht auf Kontaktereignisse reagieren. Für geschickte Manipulationen ist der empfohlene Ausgangspunkt Tp=16, Ta=8 und dann basiert auf den von Ihnen beobachteten Aufgabenfehlermodus.

# Installieren Sie Diffusionspolitik (Columbia Referenz Implementierung) git clone T24 cd diffusion_policy conda env erstellen -f conda_environment.yaml conda aktivieren Robodiff # Train CNN Variante auf einem Push-T Datensatz python train.py --config-name=train_diffusion_unet_lowdim_push_t_work space # Trainieren Sie auf Ihrem eigenen Datensatz (Le train.t_work space) python.py --config-name=train_diffusion\unet_hybrid_work space \ task.datensatz\path=/to/your/lerobot_datensatz._actionhorizon=16 \._horizon_task.\horizon_task.\\horizon_task.\e2\e2_size=6__task.

Datenmengen, die gut mit der Diffusionspolisi funktionieren

Die Diffusionspolitik ist am besten auf Datensätzen mit folgenden Merkmalen:

  • Glatte, kontinuierliche Bahnen: Da der Entwässerungsprozess glatte Ausgänge erzeugt, verursachen Demonstrationen mit zerklüftenden oder diskontinuierlichen Bewegungen eine Mischstellung zwischen der induktiven Voreingenommenheit des Modells und den Trainingsdaten.
  • Konsistente Aufzeichnung des Endfaktorzustands: Die Diffusionsrichtlinie in der Standardvariante CNN verwendet Endfaktorposition+Orientierung+Greifer als Aktion, nicht als Gelenkspiel.
  • ** Mehrere Ansichten, wenn verfügbar:** Die Transformatorvariante (DP-T) kann 23 Kameraansichten als Token verwenden.

Veröffentlichte Benchmark-Daten, die mit der Diffusionpolitik kompatibel sind

Dataset Tasks Notes
Push-T (Columbia) T-block pushing Reference benchmark; highly multimodal; download from diffusion_policy repo
RoboMimic Can, Lift, Square, Transport Standard benchmark; MH (multi-human) subset tests multimodal handling best
ALOHA / ACT datasets Bimanual tabletop tasks Requires joint-space conversion; diffusion policy-T performs comparably to ACT
DROID (Google) 76,000 diverse robot episodes Large-scale; good for fine-tuning pretrained diffusion models
RCSV custom datasets Varies by project Delivered in LeRobot format; compatible with diffusion_policy repo out of the box

RCSV-Hardware-Empfehlungen für die Diffusionspolitik

Die beste Aufgabe: Wuji Hand

Für Aufgaben, die Fingerlevel-Fähigkeit erfordern Handmanipulation, Greifanpassung, Objektorialierung die [Wuji Hand]T11) ist die stärkste Plattform für Diffusionspolitik bei RCSV. Mit 20 aktiven DOF und 768-Punkte-Takt-Sensing pro Fingerspitze bietet es sowohl einen reichen Aktionsraum als auch einen reichen Beobachtungsraum, den die Transformatorvariante der Diffusionspolitik voll ausnutzen kann. In unseren internen Benchmarks übertrifft die Diffusion Policy-T on Wuji Hand die ACT bei Aufgaben mit kontaktreichen Fingerabläufen um 1825 Prozentpunkte in der Erfolgsrate.

Das 768-Punkte-Takt-Array erzeugt pro Hand einen 768-Dimension-Beobachtungsvektor, den wir für den DP-T-Transformator flachen und tokenizieren.

Tisch-Manipulation: OpenArm-Basis

Für Standard-Tischtop-Pick-and-Place, Montage und Werkzeugnutzungsaufgaben ist die [OpenArm Base]T12) die kostengünstigste Plattform für Diffusionspolitikarbeit. Sie läuft bei 50Hz Joint-Position-Steuerung, unterstützt den Standard 6-DOF + Greifer-Aktionsraum, der die Referenzimplementierungsziele der Diffusionspolitik zielt, und exportiert Daten natively in LeRobot-Format. Die CNN-Variante der Diffusionpolitik zieht in 46 Stunden auf einem einzigen RTX 4090 mit OpenArm-Daten-Sets von 100 Demonstrationen.

Für die zweibäufige OpenArm-Einstellung (zwei Arme auf einem gemeinsamen Montagerahmen) wird die Transformatorvariante empfohlen die zusätzliche Kreuzwahrnehmung über die gemeinsamen Zustandvektoren aus beiden Armen erfasst zweibäufige Koordinierungsmuster, die die CNN-Variante verpasst.

Berechnungsvoraussetzungen

Configuration Minimum Recommended
DP-C (CNN, single camera) RTX 3060 12GB, 32GB RAM RTX 3090 24GB, 64GB RAM
DP-T (Transformer, 3 cameras) RTX 4080 16GB, 64GB RAM RTX 4090 24GB or A100 40GB
DP-T + Wuji tactile (768D obs) RTX 4090 24GB, 128GB RAM A100 80GB or 2x RTX 4090

Die [Datendienste] von RCSV (T13) beinhalten Zugang zu A100-Schulknoten für Diffusionspolitikläufe, die die lokale Rechenkapazität übersteigen.

Häufig gestellte Fragen

Was ist die Diffusionspolitik in der Robotik?

Die Diffusionspolitik ist ein Imitationslernalgorithmus, der die Aktionsvorhersage als einen verweigerenden Diffusionsprozess behandelt. Dieser Ansatz kann multimodal-Aktionsverteilungen mehrere gültige Wege zur Erledigung einer Aufgabe darstellen, mit denen Standardverhaltensklonung und sogar ACT kämpfen.

Wann sollte ich die Diffusionsrichtlinie anstelle von ACT verwenden?

Die Diffusionspolitik ist die bessere Wahl, wenn Ihre Aufgabe multimodale Demonstrationen (Betreiber, die die gleiche Aufgabe auf bedeutungsvolle Weise ausführen), wenn Sie eine präzise Endpunktkontrolle benötigen oder wenn Ihre Demonstrationen eine hohe Varianz haben. ACT ist schneller bei der Abschlussfolgerung und erfordert weniger Rechen für das Training, was es für latenzbeschränkte Anwendungen und Teams mit begrenzten GPU-Ressourcen besser macht. Für die meisten Aufgaben der Tabelle-Manipulation mit 50200 Demonstrationen funktionieren ACT und die Diffusionspolitik vergleichbar.

Wie lange dauert es, um eine Verbreitungspolitik zu entwickeln?

Die Ausbildung von CNN-basierten Diffusionsrichtlinien auf einem Standard-Tischdatensatz (50200 Episoden) dauert 48 Stunden auf einem einzelnen RTX 3090 oder RTX 4090. Die transformatorbasierte Variante dauert 816 Stunden für die gleiche Datensatzgröße. Die Trainingszeit schaltet sich ungefähr linear mit der Datensatzgröße aus.

Welche Hardware funktioniert am besten mit der Diffusionspolitik?

Die Diffusionspolitik wurde ursprünglich auf Aufgaben mit präzisen, glatten Bahnen benannt: Drücken, Einfügen und Pick-and-Place. Für geschickte Finger-Level-Tätigkeiten (Detail-T15) (20 DOF, 768-Punkt-Takt) in Verbindung mit der Diffusionspolitik übertreibt die ACT bei Aufgaben mit kontaktreichen Manipulationen. Für Aufgaben mit einem Tischarm ist [OpenArm Base]T16) die kostengünstigste Plattform. RCSV unterstützt beide Konfigurationen mit verwalteten Datenerfassung- und Trainingspipelines.

Verwandte Lesungen

  • [Aktpolitik erklärt] T17) Aktion Chunking mit Transformers tief Tauch
  • [ALOHA Roboternleitung] T18) Bimanuale Plattform für die Politik der ACT und der Verbreitung
  • [RoboMimic Guide]T19) Benchmark-Datenmengen, die mit der Verbreitungspolitik kompatibel sind
  • [Beste Roboter für das Imitationslernen] T20) Plattformvergleich
  • [Wuji Hand bei RCSV] T21) 20 DOF
  • [OpenArm Base] T22) Tischüberschreitende Ausbildung für die Verbreitungspolitik
  • RCSV-Datendienste Verwaltung der Datenerhebung + Ausbildungsprozesse