Diffusion Policy vs. ACT: Welchen Imitations-Lernalgorithmus wählen?
Vergleichen Sie Diffusionspolitik (DDPM-Aktionsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnitts
Zwei der am häufigsten eingesetzten Imitationslernalgorithmen der modernen Robotik
Aktualisiert April 2026 Aktionsschnitte mit MIT-Lizenz
Browse alle Modelle Sammeln Sie Demo-Daten
TL;DR Diffusion Policy Modelliert die multimodelle Verteilung von Expertenachriffen über DDPM, die den
Warum dieser Vergleich wichtig ist
Wenn Sie Ihre eigenen Teleop-Demonstrationen
Wenn Sie die falsche für Ihre Demonstrationsverteilung wählen, wird Ihre Politik entweder auf das Mittel (schlechte) oder die Demos (auch schlechte) auswendig erfassen.
Ein Blick auf den Vergleich
| Dimension | Diffusion Policy | ACT (Action Chunking Transformer) |
|---|---|---|
| Origin | Chi et al., Columbia, RSS 2023 | Zhao et al., Stanford (Mobile ALOHA), RSS 2023 |
| Architecture | CNN or transformer backbone + conditional diffusion (DDPM) action head | ResNet visual encoder + transformer encoder-decoder with CVAE latent |
| Action representation | Chunk of future actions denoised from Gaussian noise | Chunk of future actions decoded autoregressively (or in parallel) |
| Training objective | Denoising score matching / DDPM loss | Reconstruction + KL regularizer (CVAE) |
| Typical chunk size | 8–16 steps | 50–100 steps (aggressive chunking) |
| Multi-modal capture | Strong — native to the diffusion formulation | Partial — latent captures some multi-modality but can mode-collapse |
| Data needed | ~50–200 demos for narrow tasks; more helps | ~50 demos often enough for bimanual teleop tasks |
| Training time | Slower (diffusion steps increase wall-clock) | Fast — minutes to hours on a single GPU |
| Inference speed | Needs iterative denoising; DDIM or consistency models help | Fast single forward pass; chunked execution amortizes |
| Best-known wins | Push-T, real-world manipulation with multi-modal demos (+46.9% vs prior methods) | Mobile ALOHA bimanual tasks, dexterous bimanual manipulation |
| License | MIT | MIT |
| Code | github.com/real-stanford/diffusion_policy | github.com/tonyzhaozh/act |
Diffusionspolitik: Verteilungszusammenarbeit, nicht Mittelwert
Die Diffusionspolitik ist der Einblick, dass Expertendemonstrationen fast immer multimodale sind. Ein menschlicher Teleoperator, der eine Tasse erfasst, könnte bei verschiedenen Versuchen einen Seiten- oder Top-Griff verwenden; eine auf diesen Daten ausgerichtete klassische MSE- oder Kreuzentropiepolitik wird die beiden durchschnittlich und keine erzeugen. Die Diffusion Policy umgeht dies, indem sie die distribution von Aktionen über ein DDPM (Denizing Diffusion probabilistic model) modelliert.
Die [Original Diffusion Policy Paper]
Wenn die Verbreitungspolitik leuchtet
- Die Demonstrationen enthalten mehrere gültige Strategien (Griffstypen, Ansatzrichtlinien, Auslieferungsvariationen).
- Kontaktreiche Manipulation, bei der kleine Aktionsstörungen zusammengefügt sind
siehe [Kontaktreiche Manipulationsanleitung] T8 ). - Sie interessieren sich für die Robustheit der Störungen und haben das Budget für die iterative Verweigerung von Schlussfolgerungen.
- Sie wollen, dass die Politik mit mehr Daten skaliert wird, anstatt zu platonieren.
Der einfache Transformer , der die zweibrochige Krone gestohlen hat .
ACT wurde neben der Mobile ALOHA und ALOHA als Referenz-Imitations-Lernstack eingeführt. Die Architektur ist bewusst einfach: Ein ResNet kodiert jede Kameraansicht, ein Transformator-Encoder verschmilzt sie mit proprioception und ein Transformator-Decoder liefert einen Teil von 50
ACT ist sehr magisch, indem es die Länge der Teile und die Zusammenstellung vorhersagt. Durch die Vorhersage weitreichender Aktionen vermeidet es das klassische "Verbundfehler" Problem des Schritt-für-Schritt-Simulation-Lernens. Das Ergebnis: bei zweimanschließenden Teleop-Aufgaben (Cup-Staping, Velcro-Staping, Batterieneinsetzung) gelingt ACT regelmäßig mit 50 Demonstrationen, während eine Standardverhaltensklonung-Baseline Tausende benötigt.
Wenn ACT leuchtet
- Bimanuale Teleoperationsdaten
ACT wurde dafür entwickelt und zeigt. - Sie müssen schnell trainieren und auf die Aufgabe gestaltet wiederholen, anstatt auf die Diffusion zu warten, um zu konvergieren.
- Die Kontrolle ist wichtig und Sie wollen keine iterative Verweigerung in Ihrem Schleier.
- Die Demonstrationen sind relativ konsistent (einheitliche bevorzugte Strategie).
Datenanforderungen
Beide Architekturen sind nach modernen VLA-Standards dateneffizient
Inferenz und Einsatz
Die Single Forward Pass von ACT macht es zum einfachen Einsatzziel. Die Teil-Ausführung mit temporaler Zusammenstellung läuft bequem bei 30
Ehrliche Abmachungen
Die Eleganz von ACT ist auch seine Grenze. Bei Aufgaben mit wirklich multimodalen Demonstrationen kann ACT CVAE sich auf die durchschnittliche Strategie einstellen und schüchternd oder unentschlossenes Verhalten hervorrufen. Eine nützliche Heuristik: wenn Ihre Demonstrationen konsistent sind, beginnen Sie mit ACT; wenn Ihre Demonstrationen vielfältig sind, beginnen Sie mit Diffusion Policy.
Beide Algorithmen sind auch "nur" imitiertes Lernen
Benchmarks zu konsultieren
Beide Architekturen erscheinen auf [LIBERO]
Durchführungsdetails, die tatsächlich von Bedeutung sind
Beide Algorithmen sind einfacher als die meisten VLA-Papiere, aber die Details, die den Erfolg oder den Scheitern bestimmen, werden oft in der Abstraktion verloren. Bei der Diffusionspolitik** sind die drei häufigsten Fallstricke: (1) Untertraining des Deinoisers
Für ACT sind die kritischen Knopfchen Stücklänge und zeitliche Zusammenbaugewinn. Kurze Stück (unter 20 Schritte) machen ACT sich wie Vanille Verhalten Klonen und wieder einführen Kompositionsfehler. sehr lange Stück (über 200) machen die Politik zerbrechlich zu Störungen. Die ALOHA Standard von 100 Stufen mit exponentiell gewichteten Zusammenstellungen ist ein starker Ausgangspunkt
Die Kombination der beiden mit einer VLA-Stiftung
Im Jahr 2026 wählt eine wachsende Anzahl von Produktionsstacks nicht only ACT oder only Diffusion Policy
Kosten und Ingenieurleistung
Kein Algorithmus ist nach modernen Standards teuer. Eine einzige 24 GB GPU (RTX 4090 oder A6000) wird entweder ACT oder Diffusion Policy in weniger als einem Tag auf einem 50-Demo-Datensatz trainieren. ACT konvergiert in der Regel schneller in Wanduhr-Bedingungen, weil jeder Schritt ein einzelner Transformator nach vorne ist; Der Mehrschrittverlust der Diffusion Policy ist schwerer, aber konvergiert in weniger Epochen. Erwarten Sie 4
Unsere Empfehlung
Bei zweibänderlichen Teleop-Aufgaben
Verwandte Lesungen OpenVLA vs. Octo → RT-X vs. OpenVLA → Beste VLA-Modelle 2026 → Diffusionpolitik Modellseite → ALOHA Datensatz → Teleop-Datenversammlung →
Jeder VLA hier kann auf Ihre eigenen Demonstrationen abgestimmt werden.
Sammeln Sie Demo → Hardware, das es läuft → Score eine Politik →







