Zurück zu VLA Models

Diffusion Policy vs. ACT: Welchen Imitations-Lernalgorithmus wählen?

Vergleichen Sie Diffusionspolitik (DDPM-Aktionsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnittsschnitts

Zwei der am häufigsten eingesetzten Imitationslernalgorithmen der modernen Robotik ein auf der Verweigerung der Diffusion basiert, der andere auf einem CVAE-Transformator aus dem Mobile ALOHA-Projekt. Welches erfasst Ihre Teleop-Demonstrationen am besten?

Aktualisiert April 2026 Aktionsschnitte mit MIT-Lizenz

Browse alle Modelle Sammeln Sie Demo-Daten

TL;DR Diffusion Policy Modelliert die multimodelle Verteilung von Expertenachriffen über DDPM, die den Goldstandard verweist, wenn Demonstrationen "mehrere gültige Möglichkeiten" zur Durchführung einer Aufgabe zeigen. ACT (Action Chunking Transformer) von Mobile ALOHA verwendet einen CVAE-Transformator, der künftige Aktionen auf einem gelernten latenten dead simple, schnelle Züge und auf zweihandlichen Teleop-Daten vorhersagt. Diffusion Policy gewinnt auf Multi-Modal-Rohmheit; ACT gewinnt auf Einfachheit, Trainingsgeschwindigkeit und bi-manual-Fit.

Warum dieser Vergleich wichtig ist

Wenn Sie Ihre eigenen Teleop-Demonstrationen auf einem [OpenArm] T2, [ALOHA] T3) oder [Unitree G1] T4) sammeln, werden Sie entweder Diffusion Policy oder ACT lange vor dem Berühren eines Fundament VLA trainieren. Diese beiden Architekturen definieren die aktuelle Standardform für reines Imitationslernen: Beide verwenden Action-Cunking, beide sind MIT-lizenziert, beide haben Referenzimplementierungen in [LeRobot] T5), und beide werden routinemäßig als Basislinien in 20242026 Roboter-Lernpapieren zitiert.

Wenn Sie die falsche für Ihre Demonstrationsverteilung wählen, wird Ihre Politik entweder auf das Mittel (schlechte) oder die Demos (auch schlechte) auswendig erfassen.

Ein Blick auf den Vergleich

Dimension Diffusion Policy ACT (Action Chunking Transformer)
Origin Chi et al., Columbia, RSS 2023 Zhao et al., Stanford (Mobile ALOHA), RSS 2023
Architecture CNN or transformer backbone + conditional diffusion (DDPM) action head ResNet visual encoder + transformer encoder-decoder with CVAE latent
Action representation Chunk of future actions denoised from Gaussian noise Chunk of future actions decoded autoregressively (or in parallel)
Training objective Denoising score matching / DDPM loss Reconstruction + KL regularizer (CVAE)
Typical chunk size 8–16 steps 50–100 steps (aggressive chunking)
Multi-modal capture Strong — native to the diffusion formulation Partial — latent captures some multi-modality but can mode-collapse
Data needed ~50–200 demos for narrow tasks; more helps ~50 demos often enough for bimanual teleop tasks
Training time Slower (diffusion steps increase wall-clock) Fast — minutes to hours on a single GPU
Inference speed Needs iterative denoising; DDIM or consistency models help Fast single forward pass; chunked execution amortizes
Best-known wins Push-T, real-world manipulation with multi-modal demos (+46.9% vs prior methods) Mobile ALOHA bimanual tasks, dexterous bimanual manipulation
License MIT MIT
Code github.com/real-stanford/diffusion_policy github.com/tonyzhaozh/act

Diffusionspolitik: Verteilungszusammenarbeit, nicht Mittelwert

Die Diffusionspolitik ist der Einblick, dass Expertendemonstrationen fast immer multimodale sind. Ein menschlicher Teleoperator, der eine Tasse erfasst, könnte bei verschiedenen Versuchen einen Seiten- oder Top-Griff verwenden; eine auf diesen Daten ausgerichtete klassische MSE- oder Kreuzentropiepolitik wird die beiden durchschnittlich und keine erzeugen. Die Diffusion Policy umgeht dies, indem sie die distribution von Aktionen über ein DDPM (Denizing Diffusion probabilistic model) modelliert.

Die [Original Diffusion Policy Paper] T6) berichtete über eine durchschnittliche Verbesserung von 46,9% gegenüber den bisher besten Methoden des Imitationslernens über 15 Aufgaben, und die Architektur wurde zu einem Rückgrat für nachgelagerte Arbeiten wie [Octo] T7) und 3D Diffusion Policy. Die meisten Produktionsanlagen verwenden DDIM mit 510 Schritten oder einer konsistenzdestillten Variante, um in Echtzeit zu kontrollieren.

Wenn die Verbreitungspolitik leuchtet

  • Die Demonstrationen enthalten mehrere gültige Strategien (Griffstypen, Ansatzrichtlinien, Auslieferungsvariationen).
  • Kontaktreiche Manipulation, bei der kleine Aktionsstörungen zusammengefügt sind siehe [Kontaktreiche Manipulationsanleitung]T8).
  • Sie interessieren sich für die Robustheit der Störungen und haben das Budget für die iterative Verweigerung von Schlussfolgerungen.
  • Sie wollen, dass die Politik mit mehr Daten skaliert wird, anstatt zu platonieren.

Der einfache Transformer , der die zweibrochige Krone gestohlen hat .

ACT wurde neben der Mobile ALOHA und ALOHA als Referenz-Imitations-Lernstack eingeführt. Die Architektur ist bewusst einfach: Ein ResNet kodiert jede Kameraansicht, ein Transformator-Encoder verschmilzt sie mit proprioception und ein Transformator-Decoder liefert einen Teil von 50100 zukünftigen Aktionen, die auf einem gelernten CVAE-Latenz bedingt sind. Bei der Ableitung des Stückes wird der Teil mit temporaler Ensembling (durchschnittlich überlappende Vorhersagen) ausgeführt, was die Ausgabe glättet und den Zusammenschlussfehler reduziert.

ACT ist sehr magisch, indem es die Länge der Teile und die Zusammenstellung vorhersagt. Durch die Vorhersage weitreichender Aktionen vermeidet es das klassische "Verbundfehler" Problem des Schritt-für-Schritt-Simulation-Lernens. Das Ergebnis: bei zweimanschließenden Teleop-Aufgaben (Cup-Staping, Velcro-Staping, Batterieneinsetzung) gelingt ACT regelmäßig mit 50 Demonstrationen, während eine Standardverhaltensklonung-Baseline Tausende benötigt.

Wenn ACT leuchtet

  • Bimanuale Teleoperationsdaten ACT wurde dafür entwickelt und zeigt.
  • Sie müssen schnell trainieren und auf die Aufgabe gestaltet wiederholen, anstatt auf die Diffusion zu warten, um zu konvergieren.
  • Die Kontrolle ist wichtig und Sie wollen keine iterative Verweigerung in Ihrem Schleier.
  • Die Demonstrationen sind relativ konsistent (einheitliche bevorzugte Strategie).

Datenanforderungen

Beide Architekturen sind nach modernen VLA-Standards dateneffizient Sie trainieren von Grund auf eine schmale Aufgabe, nicht auf ein 7B-Modell. In der Praxis bringen 50 Demonstrationen ACT zu einer angemessenen Erfolgsrate bei einer zweimannuale Manipulations-Tasche, und Diffusion Policy benötigt typischerweise 100200 Demonstrationen, um ACT bei multimodalagen Aufgaben zu entsprechen (und dann als Demonstrationsskala zu übertreffen). Wenn Sie noch keine Daten gesammelt haben, erfassen [RCSV Teleoperationsdienste]T10) die 2050 Hz-Bimanualaufnahmen, die beide Architekturen erwarten, und unsere [ALOHA Datensatzseite]T11) hat bereits startende Korporen.

Inferenz und Einsatz

Die Single Forward Pass von ACT macht es zum einfachen Einsatzziel. Die Teil-Ausführung mit temporaler Zusammenstellung läuft bequem bei 3050 Hz auf einem Laptop-GPU. Die iterative Verkennung der Diffusion Policy ist der härtere Fall , aber die Community hat sich mit 510 Schritten oder konsistenz-destillierten Varianten auf DDIM konvertiert, was sie zu konkurrenzfähigen Frequenzen bringt. Wenn Sie auf einem Randgerät arbeiten, neigen Sie zu ACT; wenn Sie auf einer Arbeitsstation mit einem 4090 oder höher arbeiten, ist entweder in Ordnung.

Ehrliche Abmachungen

Die Eleganz von ACT ist auch seine Grenze. Bei Aufgaben mit wirklich multimodalen Demonstrationen kann ACT CVAE sich auf die durchschnittliche Strategie einstellen und schüchternd oder unentschlossenes Verhalten hervorrufen. Eine nützliche Heuristik: wenn Ihre Demonstrationen konsistent sind, beginnen Sie mit ACT; wenn Ihre Demonstrationen vielfältig sind, beginnen Sie mit Diffusion Policy.

Beide Algorithmen sind auch "nur" imitiertes Lernen sie verallgemeinern sich nicht über Ausführungsformen hinweg wie eine VLA-Stiftung. Wenn Sie einen Roboterübertragung benötigen, paaren Sie einen von ihnen mit [OpenVLA]T12) oder [Octo]T13) und verwenden Sie ACT/Diffusion Policy als Ausführungs-spezifisches Aktionskopf.

Benchmarks zu konsultieren

Beide Architekturen erscheinen auf [LIBERO]T14) und in den Push-T / Robomimic Suiten.

Durchführungsdetails, die tatsächlich von Bedeutung sind

Beide Algorithmen sind einfacher als die meisten VLA-Papiere, aber die Details, die den Erfolg oder den Scheitern bestimmen, werden oft in der Abstraktion verloren. Bei der Diffusionspolitik** sind die drei häufigsten Fallstricke: (1) Untertraining des Deinoisers Teams stoppen bei 50K Schritten, wenn 200K routinemäßig benötigt wird, (2) Fehl-Ausrichtung der Aktionsnormalität, insbesondere wenn die Aktionen sowohl Position als auch Griffbits umfassen, und (3) die Verwendung von EMA-Gewichten bei der Schlussfolgerung.

Für ACT sind die kritischen Knopfchen Stücklänge und zeitliche Zusammenbaugewinn. Kurze Stück (unter 20 Schritte) machen ACT sich wie Vanille Verhalten Klonen und wieder einführen Kompositionsfehler. sehr lange Stück (über 200) machen die Politik zerbrechlich zu Störungen. Die ALOHA Standard von 100 Stufen mit exponentiell gewichteten Zusammenstellungen ist ein starker Ausgangspunkt nur abtun, wenn Sie jitter oder nach oben sehen, wenn Sie langen Horizont-Drift sehen.

Die Kombination der beiden mit einer VLA-Stiftung

Im Jahr 2026 wählt eine wachsende Anzahl von Produktionsstacks nicht only ACT oder only Diffusion Policy sie verwenden einen als die niedrigste Maßnahme hinter einem Stiftungs-VLA. Das Muster: Eine VLA wie [OpenVLA]T16) analysiert die Natursprachenanweisung in ein scenenbewusstes Sub-Ziel, und ein ACT oder Diffusion Policy-Head führt die feinen Körner-Bewegung aus. So wurden die meisten der am besten erfolgreichen CALVIN- und LIBERO-Beiträge im Jahr 2025 strukturiert, und es spiegelt eine wachsende Arbeitsteilung im Bereich wider: Grundmodelle für Sprache und Abstraktion, Imitationslernungspolitik für geschickte Ausführung.

Kosten und Ingenieurleistung

Kein Algorithmus ist nach modernen Standards teuer. Eine einzige 24 GB GPU (RTX 4090 oder A6000) wird entweder ACT oder Diffusion Policy in weniger als einem Tag auf einem 50-Demo-Datensatz trainieren. ACT konvergiert in der Regel schneller in Wanduhr-Bedingungen, weil jeder Schritt ein einzelner Transformator nach vorne ist; Der Mehrschrittverlust der Diffusion Policy ist schwerer, aber konvergiert in weniger Epochen. Erwarten Sie 412 Stunden Gesamtschulzeit für eine anständige Politik bei einer engen Aufgabe mit der Vorbeugung, dass die Datenerhebung und -kuration viel länger dauern als die Ausbildung selbst.

Unsere Empfehlung

Bei zweibänderlichen Teleop-Aufgaben insbesondere auf [ALOHA]T17) oder [G1]T18) -Stil-Hardware beginnen Sie mit ACT. Sie werden in einem Nachmittag laufen und die Basislinie ist schwer mit 50 Demos zu schlagen. Für Einarmmanipulation mit verschiedenen Demonstrationen oder kontaktreichen Aufgaben, beginnen Sie mit Diffusion Policy. Wenn Sie Zweifel haben, trainieren Sie beide sie sind billig genug, um parallel zu laufen, und wenn Sie beide erfolgreich oder beide scheitern sehen, sagt Ihnen etwas Wichtiges über Ihren Datensatz.

Verwandte Lesungen OpenVLA vs. Octo → RT-X vs. OpenVLA → Beste VLA-Modelle 2026 → Diffusionpolitik Modellseite → ALOHA Datensatz → Teleop-Datenversammlung →

Jeder VLA hier kann auf Ihre eigenen Demonstrationen abgestimmt werden.

Sammeln Sie Demo → Hardware, das es läuft → Score eine Politik →