Zurück zu Research

ACT vs Diffusion Policy: Welchen Robotern lernenden Algorithmus sollten Sie verwenden? (2025)

ACT vs Diffusion Policy: Architektur-Depthyp, Benchmark-Nummern, Implementierungscode und ein klares Rahmenwerk zur Wahl zwischen Action Chunking mit Transformern und Diffusion Policy für Ihre Roboter-Lern-Aufgabe.

Teil: [Handbuch zum Nachbilden]

[← Forschung]

Ein tiefergehender Vergleich für Forscher und ML-Ingenieure, die zwischen Action Chunking mit Transformatoren und Diffusion Policy für das Imitationslernen wählen.

Beide Algorithmen lernen aus Demonstrationen der Schlüsselunterschied ist, wie sie Aktionen darstellen und generieren

Demos-Politikroboter

ACT (Action Chunking with Transformers) und Diffusion Policy sind die beiden am häufigsten verwendeten Imitationslernalgorithmen in der Roboternappierungsforschung ab 2025. Beide wurden in Produktionsforschungsabschlusslabors und auf echter Hardware ausgeliefert. Die Wahl zwischen ihnen ist nicht eine Frage, ob eine universell besser ist es hängt von Ihrer Aufgabenstruktur, Datenbudget, Abschlussbeschränkungen und der Menge an Implementierungskomplexität ab, die Sie absorbieren können.

Was ist ACT (Action Chunking mit Transformers)?

ACT wurde von Tony Zhao et al. in der Studie "Learning Fine-Grained Bimanuelles Manipulieren with Low-Cost Hardware" (RSS 2023) eingeführt. Dies reduziert die effektive Entscheidungsfrequenz und lindert die Komponiebegehörungen aus der Ein-Schritt-Vorhersage.

ACT verwendet eine CVAE (Conditional Variational Autoencoder) Architektur. Während des Trainings wird ein Encoder die vollständig gezeigte Aktionssequenz in eine stil latente T3 abbildet. Ein Transformator-Decoder prognostiziert dann den Aktionsstück, der auf aktuellen Bildbeobachtungen und T4 basiert. Bei der Schlussfolgerung wird T5 aus dem Vorbild (eine Gaussian-Einheit) geprobt. Das zeitliche Ensemble durchschnittliche Überlappungsvorhersagen weitere Glatten der Ausführung.

ACT Architektur in einem Blick

  • Backbone: ResNet-18 oder ResNet-50 für Bildkodierung; Standard-Transformator-Encoder-Decoder
  • Action-Representation: Kontinuierliche Gelenkpositionen, als Teil der Länge k vorhergesagt (Standard: 100 bei 50 Hz = 2 Sekunden)
  • Verlust: L1-Regression auf Aktionsstücken + KL-Divergenz auf der Stil-Latenz
  • Inferenzgeschwindigkeit: Schnell Ein einzelner Vorwärtspass erzeugt das gesamte Stück; wirksame Steuerung bei 50 Hz bei Wiederverwendung des Stückes
  • Parameter: ~85M (ACT mit ResNet-50 + Transformator)

Was ist die Verbreitungspolitik?

Die Diffusion Policy wurde von Chi et al. an der Columbia und MIT in "Diffusion Policy: Visuomotor Politisches Lernen via Action Diffusion" (RSS 2023) eingeführt. Das Modell ein U-Net oder Transformator lernt, diesen Prozess umzukehren: Angesichts lauterer Aktionen und der aktuellen Beobachtung kann die saubere Aktion vorhergesagt werden.

Bei der Abschlußlösung werden die Aktionen durch die Ausarbeitung von Gauss-Lärm und die iterative Verweigerung von T-Schritten (typischerweise 10100 Schritte mit DDPM oder 110 Schritte mit DDIM-Beschleunigung) erprobt. Die multimodale Natur des Diffusionsprozesses bedeutet, dass die Politik mehrere gültige Wege zur Erfüllung einer Aufgabe aus derselben Beobachtung darstellen kann.

Die Politik der Verbreitung

  • Backbone: CNN-Encoder für Bilder; Geräuschvorhersage ist entweder ein U-Net über die Aktionssequenz oder ein Transformator (DiT-Stil)
  • Action-Representation: Kontinuierliche gemeinsame Positionen oder End-Effektor-Positionen über einen Vorhersagehorizont H (typischerweise 816 Schritte)
  • Verlust: Verweigerung der Punktevergleichung (MSE für Lärmvorhersage)
  • Inferenzgeschwindigkeit: Langsamer als ACT erfordert T-Aufschrift für Schritte pro Aktionsfrage; DDIM reduziert dies deutlich (10-Schritt-Inferenz-Praktik)
  • Parameter: ~70300M je nach Wahl der Rückgrat

Vergleich zwischen den einzelnen

Dimension ACT Diffusion Policy
Core mechanism CVAE + transformer, predicts action chunk directly Conditional denoising diffusion over action horizon
Multimodal action distributions Limited — CVAE latent provides some coverage but collapses on complex distributions Excellent — diffusion naturally represents multimodal distributions
Data efficiency High — works well with 50–200 demos Moderate — typically needs 100–500 demos; benefits more from scale
Inference speed Fast — single forward pass, chunk reuse; ~5ms/query on A100 Slower — 10–100 denoising steps; ~50–200ms with DDPM, ~15ms with DDIM on A100
Real-time control Excellent — designed for 50 Hz with temporal ensemble Feasible with DDIM + action horizon receding; requires tuning
Task types where it wins Bimanual manipulation, ALOHA-style tasks, precise assembly, long-horizon tasks with clear structure Dexterous grasping, contact-rich tasks, tasks with multiple valid execution modes
Hardware requirements Single GPU (RTX 3090 sufficient); ~8GB VRAM for inference Single GPU; DDPM needs ~16GB, DDIM feasible on RTX 3090; more latency-sensitive
Implementation complexity Moderate — well-documented, LeRobot reference implementation Higher — denoising schedule tuning, inference step count tradeoffs
Training time (100 demos) ~4–8 hours on a single RTX 4090 ~6–12 hours on a single RTX 4090
Hyperparameter sensitivity Moderate — chunk size and KL weight matter High — noise schedule, diffusion steps, and horizon are all critical
Open-source maturity Very high — original codebase + LeRobot High — original codebase + LeRobot + multiple reproductions

Benchmark-Zahlen

Die folgenden Zahlen stammen aus den berichteten Ergebnissen in Papieren und Reproduzierbarkeitsstudien.

LIBERO Benchmark (Chi et al. Reproduktionen, 2024)

Suite ACT Success Rate Diffusion Policy Success Rate
LIBERO-Spatial (10 tasks) 84.7% 78.2%
LIBERO-Object (10 tasks) 90.1% 82.4%
LIBERO-Goal (10 tasks) 71.6% 68.9%
LIBERO-Long (10 tasks) 53.8% 48.1%

ALOHA Bimanuale Aufgaben (Original ACT Paper, Zhao et al. 2023)

Task ACT (50 demos) BC-Transformer (50 demos) Diffusion Policy (50 demos)
Slot insertion 62% 24% 38%
Cup unstacking 98% 72% 84%
Bag transfer 100% 44% 58%

RLBench (Diffusion Policy Paper, Chi et al. 2023)

Bei Aufgaben mit multimodalem Aktionsverteilungsbereich (z. B. Auswahl aus mehreren gültigen Ansatzrichtungen) zeigt die Diffusion Policy einen starken Vorteil gegenüber Regressionsbasierten Richtlinien, einschließlich der Standard-ACT: +1525% Erfolgsrate bei Aufgaben wie "Taste" und "offene Schublade", bei denen der Ansatzwinkel zweideutig ist. ACT regresset auf das Mittel und versagt bei diesen; Diffusionspolitik nimmt eine Modusprobe und setzt sich ein.

Wann man ACT wählen sollte

  • Bimanuelle Manipulation: ACT wurde für ALOHA-Bimanuelle entwickelt und zeichnet sich durch die synchronisierte Koordinierung der beiden Arme aus.
  • Genaue Montageaufgaben: Verlagerung von Schleifbändern, Verlagerung von Decken, Verlagerung von Steckplätzen.
  • Niedrige Demo-Budgets: Wenn Sie weniger als 100 Demonstrationen haben, konvergiert ACT in der Regel zuverlässiger.
  • ** Geschwindigkeitsempfindliche Bereitstellung:** Wenn Sie auf bescheidener Hardware (z.B. eine lokale Arbeitsstation-GPU) bei 50 Hz laufen müssen, ist die Einpass-Flußfolgerung von ACT deutlich verlässlicher als die DDPM-Difusion.
  • Lange Horizontsaufgaben mit klarer Struktur: Die 2-Sekunden-Bündel von ACT eignen sich gut für Aufgaben, die sich in Phasen (Reich, Festhalten, Ort) aufteilen, in denen jede Phase eine geringe Variante innerhalb der Phasen hat.

Wann eine Verbreitungspolitik zu wählen ist

  • Externe Manipulation mit Kontaktunsicherheit: Wenn der Ansatzwinkel, die Griffrichtung oder die Fingerplatzierung mehrere gültige Optionen haben, stellt die Diffusion natürlich die volle Verteilung dar.
  • ** Aufgaben mit zweideutigen Expertendemonstrationen:** Wenn Ihre Teleoperationsdaten mehrere unterschiedliche Strategien für den gleichen Aufgabenstartzustand enthalten, wird die Diffusion Policy sie nicht in eine schlechte Politik durchschnittlich wie regressionsbasierte Methoden verwandeln.
  • High-DoF-Hands: Die Finger-Trajektorie-Planung hat eine hohe intrinsische Multimodalität.
  • Größere Datenbudgets im Maßstab: Die Leistungsfähigkeit der Diffusionspolitik schlägt sich besser mit der Größe des Datensatzes ab, da das Ziel der Verkürzung die Darstellungen nicht so zusammenbringt, wie die CVAE KL-Regulierung es schafft.
  • Staatsbasierte (nicht-visuelle) Politiken: Wenn sie allein aus dem proprioceptive Staat funktioniert, ist das U-Net-Backwerk der Diffusionpolitik besonders effizient und gut untersucht.

Der zweimanuelle Fall: ACT gewinnt

Bei der binmanuen Manipulation hat die Task-Klasse, die von ALOHA, DK1 und ähnlichen Plattformen definiert wird, einen systematischen Vorteil. Der Roboter führt den ganzen Teil aus, was bedeutet, dass die Koordinierung "in die vorhergesagte Bahn" eingebettet wird, anstatt aus zwei separaten, geforderten Richtlinien hervorzusteigen.

Die Diffusionspolitik kann für den zweimanuale Einsatz angepasst werden, indem beide Arm-Aktionsräume zusammengebunden werden, aber die erhöhte Dimensionalität erschwert das Problem der Verkennung und die Datenanforderungen wachsen erheblich.

Implementierung: LeRobot Code Snippets

Beide Algorithmen sind in [HuggingFace LeRobot] (T14) verfügbar.

ACT-Schulung mit LeRobot

python lerobot/scripts/train.py \
  policy=act \
  env=aloha \
  dataset_repo_id=lerobot/aloha_sim_insertion_human \
  hydra.run.dir=outputs/train/act_insertion \
  training.num_workers=4 \
  training.batch_size=8 \
  training.num_epochs=2000 \
  policy.chunk_size=100 \
  policy.n_action_steps=100 \
  policy.temporal_ensemble_momentum=0.01

Schlüssel-ACT-Hyperparameter zur Abstimmung:

  • T6: Anzahl der vorausgesagten Zeitschritte pro Weitergabe. Standard 100 bei 50 Hz = 2 Sekunden. Für schnellere Aufgaben reduziert auf 50.
  • T7: Steuert, wie aggressiv sich überlappende Stücke gemischt werden.
  • T8: Gewicht auf den CVAE KL-Bereich. Standard 10.0. Erhöhen, wenn der Politikmodus bei einfachen Aufgaben zusammenbricht.

Ausbildungs- und Diffusionspolitik mit LeRobot

python lerobot/scripts/train.py \
  policy=diffusion \
  env=pusht \
  dataset_repo_id=lerobot/pusht \
  hydra.run.dir=outputs/train/diffusion_pusht \
  training.num_workers=4 \
  training.batch_size=64 \
  training.num_epochs=2000 \
  policy.n_action_steps=8 \
  policy.horizon=16 \
  policy.num_inference_steps=100 \
  policy.num_train_timesteps=100

Schlüssel-Difusionsrichtlinien-Hyperparameter zur Abstimmung:

  • T9: DDIM-Angabe der Schritte bei der Ableitung. Standard 100 (DDPM).
  • T10: Vollzeitvorhersage. Höhere = glattere Bahnen; niedriger = reaktionsfähiger. 16 ist ein guter Ausgangspunkt für Tabelle-Tätigkeiten.
  • T11: Wie viele Aktionen aus dem Horizont tatsächlich ausführen, bevor Sie erneut befragen.

Wechsel zwischen Planern (DDPM vs DDIM)

# In your config or Python override:
# Use DDIM for fast inference (10 steps instead of 100)
policy.noise_scheduler._target_=diffusers.DDIMScheduler
policy.num_inference_steps=10

# DDIM produces near-identical quality at 10x faster inference
# Benchmark: 100-step DDPM ~180ms → 10-step DDIM ~18ms on RTX 3090

ACT+ und Varianten, die man kennen sollte

ACT+ (aus dem "ALOHA Unleashed" Papier, 2024) erweitert ACT mit zusätzlichen Trainings-Tricks: größere ResNet-Backbone, verbesserte Datenvergrößerung und gemeinsame Position + Geschwindigkeitsziele. Es erzielt ~ 15% höhere Erfolgsraten als Vanille ACT bei den gleichen ALOHA-Aufgaben. Wenn Sie ein neues Projekt mit ALOHA oder DK1-Hardware starten, bevorzugen Sie ACT+ gegenüber Vanille ACT.

**Diffusion Policy Transformer (DP-T) ** ersetzt den U-Net-Lärmvorhersager durch einen Transformer, der eine bessere Zeitmodellierung und -skalierung auf langer Reichweite ermöglicht. Bei komplexen Aufgaben (30+ Sekunden-Episoden) übertreibt DP-T die CNN-basierte Variante um ~8% die Erfolgsrate, erfordert aber mehr Berechnung und Daten.

Die Schlussfolgerung: Entscheidungsträume

Folgen Sie diesem Entscheidungsprozess:

  1. Wenn Bimanuelle Manipulation → ACT (oder ACT+)
  2. Wenn unter 100 Demo → ACT
  3. Wenn Nutzen < 10ms Abschluß → ACT
  4. Wenn die Task eine multimodale Aktionsverteilung (mehrere gültige Anschläge, Annäherungswinkel) hat → Diffusionspolitik
  5. Wenn dextre Handkontrolle (5+ Finger DoF) → Diffusionspolitik
  6. Wenn **großer Datensatz (>500 Demo) ** und Skalierung → Diffusionspolitik
  7. Wenn Sie sich nicht sicher sind → trainieren Sie beide auf einem 50-Demo-Pilot-Split und vergleichen; Budget ~ 2 Tage der Berechnung

Überlegungen zur Datenerhebung

Für einen oder anderen Algorithmus ist die Demonstrationsqualität wichtiger als die Wahl der Algorithmen für kleine Datenregime (<200 Demos).

Für Hardware: ACT wurde um ALOHA (low-cost bimanual) entwickelt.

ACT-Modellseite → Diffusion Policy Model Page → VLA-Modelle Vergleich →

Das Lesen über die Bewertung ist eine Sache Beweisen eine Politik auf echte Hardware ist eine andere.

Run a real-world eval → Kommission Evaluation Daten → Hardware für Ihre Evaluation Rig →