Diffusionspolitik für Roboterlernen: Wie funktioniert sie und wann sie verwendet werden (2026)
Diffusion Policy für Robotermanipulation: Wie denoisieren Aktionen vorhersagt, CNN vs Transformer, und wann es ACT und Verhaltenskloning übertrifft. 2026 Guide.
Die Diffusionspolitik ist der führende Imitationslernalgorithmus für kontaktreiche und geschickte Robotermanipulationsaufgaben. Es übertrifft konsequent die Standardverhaltenskloning
Was ist die Verbreitungspolitik?
Die Diffusionspolitik, die von Chi et al. an der Columbia University im Jahr 2023 eingeführt wurde, wendet den Score-Matching-Framework von Bildgenerierung-Difusion-Modellen (DDPM, DDIM) auf Roboter-Aktionsvorhersage an. Anstatt eine einzelne nächste Aktion oder eine kurze Aktionssequenz aus einer Beobachtung zu prognostizieren, lernt die Politik, eine zufällige Aktionsbahn in einen kohärenten, hochwertigen Bewegungsplan iterativ zu verweisen. Das Ergebnis ist eine Handlungspolitik, die in der Praxis deutlich besser mit der multimodalen Natur menschlicher Demonstrationsdaten umgeht als die klassische Verhaltensklonung.
Die Kerninsigne ist einfach: Wenn Sie Roboterdemonstrationen von menschlichen Operatoren sammeln, erfüllen verschiedene Operatoren oft die gleiche Aufgabe qualitativ unterschiedlich
Die Arbeit zeigte eine Diffusionspolitik für 12 simulierte und reale Roboter-Manipulationsaufgaben und erzielte auf 11 von ihnen hochmoderne Ergebnisse.
Wie die Verbreitungspolitik funktioniert
Die Ausbildung und die Ableitung für die Diffusionspolitik folgen dem Standard-DDPM-Denkungsrahmen, der an Handlungsschritte anstelle von Bildern angepasst ist.
Ausbildung
Während des Trainings wird eine saubere Aktionsbahn
Inferenz
Bei der Ableitung beginnt das Modell mit einem reinen Lärmvektor der gleichen Dimensionalität wie eine Aktionssequenz. Es führt dann K-Dennosing-Schritte (typischerweise K=10 für DDIM, K=100 für DDPM)
Die Beobachtungskonditionierung ist die wichtigste architektonische Wahl.
- CNN-basierte (DP-C): Ein ResNet-18 oder ResNet-34-Spielraum kodiert Bildbeobachtungen in einen Feature-Vektor, der dann mit proprioceptive Zustand verschmolzen und verwendet wird, um den denodierende CNN zu konditionieren. Schneller zu trainieren und zu schließen; besser für Einzelschaltungen.
- Transformatorbasiert (DP-T): Ein Transformator im ViT-Stil kodiert Bildtoken und verschmilzt sie mit proprioception Token.
Abläuferung der Horizontkontrolle
Eine kritische Implementierungsdetail: Die Diffusionspolitik verwendet einen Abstandshorizontansatz. Die Politik prognostiziert eine Aktionssequenz von Tp Länge (z.B. 16 Schritte), führt aber nur die ersten Ta Schritte (z.B. 8 Schritte) vor der Neuplanung aus. Dies schafft ein Gleichgewicht zwischen zeitlicher Konsistenz ( längere Tp = glattere Bewegungen) und Reaktivität (kurzer Ta = schnellere Reaktion auf unerwartete Veränderungen). Das Verhältnis Tp/Ta = 2 ist standardmäßig und funktioniert gut für die meisten Manipulationsarbeiten.
Diffusionspolitik gegenüber ACT: Ein praktischer Vergleich
| Property | Diffusion Policy | ACT (Action Chunking Transformers) |
|---|---|---|
| Multimodal action distributions | Excellent — models full distribution | Good — CVAE captures variance but can mode-average |
| Inference latency (RTX 3090) | 40–120ms (DDIM K=10 to K=100) | ~10ms (single forward pass) |
| Training time (50 demos, RTX 3090) | 4–8 hours (CNN), 8–16 hours (Transformer) | 2–4 hours |
| Temporal consistency | High — denoising produces smooth trajectories | High — action chunking provides consistency |
| Bimanual coordination | Good with transformer variant | Excellent — natively designed for ALOHA bimanual |
| Dexterous hand control (20+ DOF) | Excellent — handles high-dim action spaces well | Moderate — chunk size tuning needed for high DOF |
| Open-source reference implementation | Yes — diffusion_policy repo (Columbia) | Yes — act repo (Stanford) |
| LeRobot integration | Yes — native support | Yes — native support |
Der Überschriftvergleich: ACT ist schneller bei der Abschlussung und leichter zu trainieren, was es für zeitkritische Systeme und Teams mit begrenztem Rechenwert besser macht. In der Praxis ist die Leistung für die meisten Aufgaben der Tabelle-Manipulation mit 50
Diffusionspolitik vs. Standardverhaltenskloning
Standardverhaltensklonung (BC) minimiert die MSE zwischen vorhergesagten und demonstrierten Aktionen. Dies funktioniert, wenn der Demonstrationsdatensatz einmodal ist
Die Diffusionspolitik vermeidet Modus-Durchschnitt, weil sie die gesamte bedingte Verteilung p
Wenn Ihre Aufgabe in den gezeigten Bahnen weniger als 5% abweicht (d.h. alle Betreiber tun genau das gleiche), kann BC mit einem guten Rückgrat die Diffusionspolitik entsprechen.
Wann eine Verbreitungspolitik zu wählen ist
Wählen Sie die Diffusionsrichtlinie, wenn:
- Ihre Demonstrationen sind multimodal. Wenn verschiedene Betreiber die Aufgabe mit bedeutungsvollen unterschiedlichen Bewegungssätzen erfüllen, verarbeitet die Diffusionspolitik dies besser als ACT oder BC.
- Ein hoher DOF-Aktionsraum ist vorhanden. Dexterose Hände (16
20+ DOF) profitieren mehr von der Fähigkeit der Diffusionspolitik, gemeinsame Korrelationen über die volle Aktionsdimension zu modellieren als der feststeckende, stückbasierte Ansatz von ACT. - Sie benötigen eine genaue Positionierung der Endpunkte. Das Originalpapier zeigte, dass die Diffusionspolitik aufgrund der iterativen Verfeinerung beim Entzünden eine Präzisions-Einsetzen-Genauigkeit von unter 2 mm erreicht.
- Sie vergleichen die veröffentlichten Ergebnisse. Viele jüngste Arbeiten (2024
2026) berichten über die Diffusionspolitik als Ausgangslinie. - Sie haben mehr GPU-Budget für das Training. Wenn Sie mehrere GPUs haben, parallelisiert sich die Ausbildungspolitik für Diffusion gut und die Transformatorvariante erzielt bessere Ergebnisse mit mehr Rechenleistung.
Wählen Sie ACT Wenn:
- Die Latenz der Inferenz ist kritisch. ACT kann bei 10 ms pro Inferenzschritt bei 100 Hz auf bescheidener Hardware laufen.
- Sie arbeiten mit ALOHA-Format-Bimanual-Daten. ACT wurde für ALOHA entwickelt und die Referenzimplementierung erfordert keine Formatkonvertierung.
- Behandlung ist begrenzt. Ein 2-stündiges ACT-Training läuft gegenüber 4
8 Stunden für Fragen der Diffusionpolitik, wenn Sie schnell auf die Aufgabenentwicklung iterieren. - Sie entsprechen einem bestimmten vorherigen Ergebnis. Wenn Sie die ACT-Zahlen von Stanford genau reproduzieren müssen, verwenden Sie ACT.
Schlüssel-Hyperparameter für die Diffusionspolitik
Dies sind die Parameter, die die Nadel in der Praxis tatsächlich bewegen, in grob abnehmender Bedeutung:
| Parameter | Default | Effect of Increasing |
|---|---|---|
pred_horizon (Tp) |
16 | Smoother trajectories; slower re-planning; more memory |
action_horizon (Ta) |
8 | Fewer inference calls; less reactive to perturbations |
obs_horizon |
2 | More temporal context; helps with tasks requiring memory of recent motion |
num_diffusion_iters (K) |
10 (DDIM), 100 (DDPM) | Higher quality actions; slower inference |
noise_scheduler |
DDIM | DDPM is higher quality but 10x slower; DDIM preferred for real-time use |
vision_encoder |
ResNet-18 | ResNet-34 / ViT improves performance; requires more compute |
n_obs_steps |
2 | Stacking more observation frames helps tasks with motion-based cues (sliding, rotating) |
Der häufigste Fehler: Die Einstellung von
# Installieren Sie Diffusionspolitik (Columbia Referenz Implementierung) git clone
Datenmengen, die gut mit der Diffusionspolisi funktionieren
Die Diffusionspolitik ist am besten auf Datensätzen mit folgenden Merkmalen:
- Glatte, kontinuierliche Bahnen: Da der Entwässerungsprozess glatte Ausgänge erzeugt, verursachen Demonstrationen mit zerklüftenden oder diskontinuierlichen Bewegungen eine Mischstellung zwischen der induktiven Voreingenommenheit des Modells und den Trainingsdaten.
- Konsistente Aufzeichnung des Endfaktorzustands: Die Diffusionsrichtlinie in der Standardvariante CNN verwendet Endfaktorposition+Orientierung+Greifer als Aktion, nicht als Gelenkspiel.
- ** Mehrere Ansichten, wenn verfügbar:** Die Transformatorvariante (DP-T) kann 2
3 Kameraansichten als Token verwenden.
Veröffentlichte Benchmark-Daten, die mit der Diffusionpolitik kompatibel sind
| Dataset | Tasks | Notes |
|---|---|---|
| Push-T (Columbia) | T-block pushing | Reference benchmark; highly multimodal; download from diffusion_policy repo |
| RoboMimic | Can, Lift, Square, Transport | Standard benchmark; MH (multi-human) subset tests multimodal handling best |
| ALOHA / ACT datasets | Bimanual tabletop tasks | Requires joint-space conversion; diffusion policy-T performs comparably to ACT |
| DROID (Google) | 76,000 diverse robot episodes | Large-scale; good for fine-tuning pretrained diffusion models |
| RCSV custom datasets | Varies by project | Delivered in LeRobot format; compatible with diffusion_policy repo out of the box |
RCSV-Hardware-Empfehlungen für die Diffusionspolitik
Die beste Aufgabe: Wuji Hand
Für Aufgaben, die Fingerlevel-Fähigkeit erfordern
Das 768-Punkte-Takt-Array erzeugt pro Hand einen 768-Dimension-Beobachtungsvektor, den wir für den DP-T-Transformator flachen und tokenizieren.
Tisch-Manipulation: OpenArm-Basis
Für Standard-Tischtop-Pick-and-Place, Montage und Werkzeugnutzungsaufgaben ist die [OpenArm Base]
Für die zweibäufige OpenArm-Einstellung (zwei Arme auf einem gemeinsamen Montagerahmen) wird die Transformatorvariante empfohlen
Berechnungsvoraussetzungen
| Configuration | Minimum | Recommended |
|---|---|---|
| DP-C (CNN, single camera) | RTX 3060 12GB, 32GB RAM | RTX 3090 24GB, 64GB RAM |
| DP-T (Transformer, 3 cameras) | RTX 4080 16GB, 64GB RAM | RTX 4090 24GB or A100 40GB |
| DP-T + Wuji tactile (768D obs) | RTX 4090 24GB, 128GB RAM | A100 80GB or 2x RTX 4090 |
Die [Datendienste] von RCSV (
Häufig gestellte Fragen
Was ist die Diffusionspolitik in der Robotik?
Die Diffusionspolitik ist ein Imitationslernalgorithmus, der die Aktionsvorhersage als einen verweigerenden Diffusionsprozess behandelt. Dieser Ansatz kann multimodal-Aktionsverteilungen
Wann sollte ich die Diffusionsrichtlinie anstelle von ACT verwenden?
Die Diffusionspolitik ist die bessere Wahl, wenn Ihre Aufgabe multimodale Demonstrationen (Betreiber, die die gleiche Aufgabe auf bedeutungsvolle Weise ausführen), wenn Sie eine präzise Endpunktkontrolle benötigen oder wenn Ihre Demonstrationen eine hohe Varianz haben. ACT ist schneller bei der Abschlussfolgerung und erfordert weniger Rechen für das Training, was es für latenzbeschränkte Anwendungen und Teams mit begrenzten GPU-Ressourcen besser macht. Für die meisten Aufgaben der Tabelle-Manipulation mit 50
Wie lange dauert es, um eine Verbreitungspolitik zu entwickeln?
Die Ausbildung von CNN-basierten Diffusionsrichtlinien auf einem Standard-Tischdatensatz (50
Welche Hardware funktioniert am besten mit der Diffusionspolitik?
Die Diffusionspolitik wurde ursprünglich auf Aufgaben mit präzisen, glatten Bahnen benannt: Drücken, Einfügen und Pick-and-Place. Für geschickte Finger-Level-Tätigkeiten (Detail-T15
Verwandte Lesungen
- [Aktpolitik erklärt]
T17 ) Aktion Chunking mit Transformers tief Tauch - [ALOHA Roboternleitung]
T18 ) Bimanuale Plattform für die Politik der ACT und der Verbreitung - [RoboMimic Guide]
T19 ) Benchmark-Datenmengen, die mit der Verbreitungspolitik kompatibel sind - [Beste Roboter für das Imitationslernen]
T20 ) Plattformvergleich - [Wuji Hand bei RCSV]
T21 ) 20 DOF - [OpenArm Base]
T22 ) Tischüberschreitende Ausbildung für die Verbreitungspolitik - RCSV-Datendienste
Verwaltung der Datenerhebung + Ausbildungsprozesse







