ACT vs Diffusion Policy: Welchen Robotern lernenden Algorithmus sollten Sie verwenden? (2025)
ACT vs Diffusion Policy: Architektur-Depthyp, Benchmark-Nummern, Implementierungscode und ein klares Rahmenwerk zur Wahl zwischen Action Chunking mit Transformern und Diffusion Policy für Ihre Roboter-Lern-Aufgabe.
Teil: [Handbuch zum Nachbilden]
[← Forschung]
Ein tiefergehender Vergleich für Forscher und ML-Ingenieure, die zwischen Action Chunking mit Transformatoren und Diffusion Policy für das Imitationslernen wählen.
Beide Algorithmen lernen aus Demonstrationen
Demos-Politikroboter
ACT (Action Chunking with Transformers) und Diffusion Policy sind die beiden am häufigsten verwendeten Imitationslernalgorithmen in der Roboternappierungsforschung ab 2025. Beide wurden in Produktionsforschungsabschlusslabors und auf echter Hardware ausgeliefert. Die Wahl zwischen ihnen ist nicht eine Frage, ob eine universell besser ist
Was ist ACT (Action Chunking mit Transformers)?
ACT wurde von Tony Zhao et al. in der Studie "Learning Fine-Grained Bimanuelles Manipulieren with Low-Cost Hardware" (RSS 2023) eingeführt. Dies reduziert die effektive Entscheidungsfrequenz und lindert die Komponiebegehörungen aus der Ein-Schritt-Vorhersage.
ACT verwendet eine CVAE (Conditional Variational Autoencoder) Architektur. Während des Trainings wird ein Encoder die vollständig gezeigte Aktionssequenz in eine stil latente
ACT Architektur in einem Blick
- Backbone: ResNet-18 oder ResNet-50 für Bildkodierung; Standard-Transformator-Encoder-Decoder
- Action-Representation: Kontinuierliche Gelenkpositionen, als Teil der Länge k vorhergesagt (Standard: 100 bei 50 Hz = 2 Sekunden)
- Verlust: L1-Regression auf Aktionsstücken + KL-Divergenz auf der Stil-Latenz
- Inferenzgeschwindigkeit: Schnell
Ein einzelner Vorwärtspass erzeugt das gesamte Stück; wirksame Steuerung bei 50 Hz bei Wiederverwendung des Stückes - Parameter: ~85M (ACT mit ResNet-50 + Transformator)
Was ist die Verbreitungspolitik?
Die Diffusion Policy wurde von Chi et al. an der Columbia und MIT in "Diffusion Policy: Visuomotor Politisches Lernen via Action Diffusion" (RSS 2023) eingeführt. Das Modell
Bei der Abschlußlösung werden die Aktionen durch die Ausarbeitung von Gauss-Lärm und die iterative Verweigerung von T-Schritten (typischerweise 10
Die Politik der Verbreitung
- Backbone: CNN-Encoder für Bilder; Geräuschvorhersage ist entweder ein U-Net über die Aktionssequenz oder ein Transformator (DiT-Stil)
- Action-Representation: Kontinuierliche gemeinsame Positionen oder End-Effektor-Positionen über einen Vorhersagehorizont H (typischerweise 8
16 Schritte) - Verlust: Verweigerung der Punktevergleichung (MSE für Lärmvorhersage)
- Inferenzgeschwindigkeit: Langsamer als ACT
erfordert T-Aufschrift für Schritte pro Aktionsfrage; DDIM reduziert dies deutlich (10-Schritt-Inferenz-Praktik) - Parameter: ~70
300M je nach Wahl der Rückgrat
Vergleich zwischen den einzelnen
| Dimension | ACT | Diffusion Policy |
|---|---|---|
| Core mechanism | CVAE + transformer, predicts action chunk directly | Conditional denoising diffusion over action horizon |
| Multimodal action distributions | Limited — CVAE latent provides some coverage but collapses on complex distributions | Excellent — diffusion naturally represents multimodal distributions |
| Data efficiency | High — works well with 50–200 demos | Moderate — typically needs 100–500 demos; benefits more from scale |
| Inference speed | Fast — single forward pass, chunk reuse; ~5ms/query on A100 | Slower — 10–100 denoising steps; ~50–200ms with DDPM, ~15ms with DDIM on A100 |
| Real-time control | Excellent — designed for 50 Hz with temporal ensemble | Feasible with DDIM + action horizon receding; requires tuning |
| Task types where it wins | Bimanual manipulation, ALOHA-style tasks, precise assembly, long-horizon tasks with clear structure | Dexterous grasping, contact-rich tasks, tasks with multiple valid execution modes |
| Hardware requirements | Single GPU (RTX 3090 sufficient); ~8GB VRAM for inference | Single GPU; DDPM needs ~16GB, DDIM feasible on RTX 3090; more latency-sensitive |
| Implementation complexity | Moderate — well-documented, LeRobot reference implementation | Higher — denoising schedule tuning, inference step count tradeoffs |
| Training time (100 demos) | ~4–8 hours on a single RTX 4090 | ~6–12 hours on a single RTX 4090 |
| Hyperparameter sensitivity | Moderate — chunk size and KL weight matter | High — noise schedule, diffusion steps, and horizon are all critical |
| Open-source maturity | Very high — original codebase + LeRobot | High — original codebase + LeRobot + multiple reproductions |
Benchmark-Zahlen
Die folgenden Zahlen stammen aus den berichteten Ergebnissen in Papieren und Reproduzierbarkeitsstudien.
LIBERO Benchmark (Chi et al. Reproduktionen, 2024)
| Suite | ACT Success Rate | Diffusion Policy Success Rate |
|---|---|---|
| LIBERO-Spatial (10 tasks) | 84.7% | 78.2% |
| LIBERO-Object (10 tasks) | 90.1% | 82.4% |
| LIBERO-Goal (10 tasks) | 71.6% | 68.9% |
| LIBERO-Long (10 tasks) | 53.8% | 48.1% |
ALOHA Bimanuale Aufgaben (Original ACT Paper, Zhao et al. 2023)
| Task | ACT (50 demos) | BC-Transformer (50 demos) | Diffusion Policy (50 demos) |
|---|---|---|---|
| Slot insertion | 62% | 24% | 38% |
| Cup unstacking | 98% | 72% | 84% |
| Bag transfer | 100% | 44% | 58% |
RLBench (Diffusion Policy Paper, Chi et al. 2023)
Bei Aufgaben mit multimodalem Aktionsverteilungsbereich (z. B. Auswahl aus mehreren gültigen Ansatzrichtungen) zeigt die Diffusion Policy einen starken Vorteil gegenüber Regressionsbasierten Richtlinien, einschließlich der Standard-ACT: +15
Wann man ACT wählen sollte
- Bimanuelle Manipulation: ACT wurde für ALOHA-Bimanuelle entwickelt und zeichnet sich durch die synchronisierte Koordinierung der beiden Arme aus.
- Genaue Montageaufgaben: Verlagerung von Schleifbändern, Verlagerung von Decken, Verlagerung von Steckplätzen.
- Niedrige Demo-Budgets: Wenn Sie weniger als 100 Demonstrationen haben, konvergiert ACT in der Regel zuverlässiger.
- ** Geschwindigkeitsempfindliche Bereitstellung:** Wenn Sie auf bescheidener Hardware (z.B. eine lokale Arbeitsstation-GPU) bei 50 Hz laufen müssen, ist die Einpass-Flußfolgerung von ACT deutlich verlässlicher als die DDPM-Difusion.
- Lange Horizontsaufgaben mit klarer Struktur: Die 2-Sekunden-Bündel von ACT eignen sich gut für Aufgaben, die sich in Phasen (Reich, Festhalten, Ort) aufteilen, in denen jede Phase eine geringe Variante innerhalb der Phasen hat.
Wann eine Verbreitungspolitik zu wählen ist
- Externe Manipulation mit Kontaktunsicherheit: Wenn der Ansatzwinkel, die Griffrichtung oder die Fingerplatzierung mehrere gültige Optionen haben, stellt die Diffusion natürlich die volle Verteilung dar.
- ** Aufgaben mit zweideutigen Expertendemonstrationen:** Wenn Ihre Teleoperationsdaten mehrere unterschiedliche Strategien für den gleichen Aufgabenstartzustand enthalten, wird die Diffusion Policy sie nicht in eine schlechte Politik durchschnittlich wie regressionsbasierte Methoden verwandeln.
- High-DoF-Hands: Die Finger-Trajektorie-Planung hat eine hohe intrinsische Multimodalität.
- Größere Datenbudgets im Maßstab: Die Leistungsfähigkeit der Diffusionspolitik schlägt sich besser mit der Größe des Datensatzes ab, da das Ziel der Verkürzung die Darstellungen nicht so zusammenbringt, wie die CVAE KL-Regulierung es schafft.
- Staatsbasierte (nicht-visuelle) Politiken: Wenn sie allein aus dem proprioceptive Staat funktioniert, ist das U-Net-Backwerk der Diffusionpolitik besonders effizient und gut untersucht.
Der zweimanuelle Fall: ACT gewinnt
Bei der binmanuen Manipulation hat die Task-Klasse, die von ALOHA, DK1 und ähnlichen Plattformen definiert wird, einen systematischen Vorteil. Der Roboter führt den ganzen Teil aus, was bedeutet, dass die Koordinierung "in die vorhergesagte Bahn" eingebettet wird, anstatt aus zwei separaten, geforderten Richtlinien hervorzusteigen.
Die Diffusionspolitik kann für den zweimanuale Einsatz angepasst werden, indem beide Arm-Aktionsräume zusammengebunden werden, aber die erhöhte Dimensionalität erschwert das Problem der Verkennung und die Datenanforderungen wachsen erheblich.
Implementierung: LeRobot Code Snippets
Beide Algorithmen sind in [HuggingFace LeRobot] (
ACT-Schulung mit LeRobot
python lerobot/scripts/train.py \
policy=act \
env=aloha \
dataset_repo_id=lerobot/aloha_sim_insertion_human \
hydra.run.dir=outputs/train/act_insertion \
training.num_workers=4 \
training.batch_size=8 \
training.num_epochs=2000 \
policy.chunk_size=100 \
policy.n_action_steps=100 \
policy.temporal_ensemble_momentum=0.01
Schlüssel-ACT-Hyperparameter zur Abstimmung:
T6 : Anzahl der vorausgesagten Zeitschritte pro Weitergabe. Standard 100 bei 50 Hz = 2 Sekunden. Für schnellere Aufgaben reduziert auf 50. T7 : Steuert, wie aggressiv sich überlappende Stücke gemischt werden. T8 : Gewicht auf den CVAE KL-Bereich. Standard 10.0. Erhöhen, wenn der Politikmodus bei einfachen Aufgaben zusammenbricht.
Ausbildungs- und Diffusionspolitik mit LeRobot
python lerobot/scripts/train.py \
policy=diffusion \
env=pusht \
dataset_repo_id=lerobot/pusht \
hydra.run.dir=outputs/train/diffusion_pusht \
training.num_workers=4 \
training.batch_size=64 \
training.num_epochs=2000 \
policy.n_action_steps=8 \
policy.horizon=16 \
policy.num_inference_steps=100 \
policy.num_train_timesteps=100
Schlüssel-Difusionsrichtlinien-Hyperparameter zur Abstimmung:
T9 : DDIM-Angabe der Schritte bei der Ableitung. Standard 100 (DDPM). T10 : Vollzeitvorhersage. Höhere = glattere Bahnen; niedriger = reaktionsfähiger. 16 ist ein guter Ausgangspunkt für Tabelle-Tätigkeiten. T11 : Wie viele Aktionen aus dem Horizont tatsächlich ausführen, bevor Sie erneut befragen.
Wechsel zwischen Planern (DDPM vs DDIM)
# In your config or Python override:
# Use DDIM for fast inference (10 steps instead of 100)
policy.noise_scheduler._target_=diffusers.DDIMScheduler
policy.num_inference_steps=10
# DDIM produces near-identical quality at 10x faster inference
# Benchmark: 100-step DDPM ~180ms → 10-step DDIM ~18ms on RTX 3090
ACT+ und Varianten, die man kennen sollte
ACT+ (aus dem "ALOHA Unleashed" Papier, 2024) erweitert ACT mit zusätzlichen Trainings-Tricks: größere ResNet-Backbone, verbesserte Datenvergrößerung und gemeinsame Position + Geschwindigkeitsziele. Es erzielt ~ 15% höhere Erfolgsraten als Vanille ACT bei den gleichen ALOHA-Aufgaben. Wenn Sie ein neues Projekt mit ALOHA oder DK1-Hardware starten, bevorzugen Sie ACT+ gegenüber Vanille ACT.
**Diffusion Policy Transformer (DP-T) ** ersetzt den U-Net-Lärmvorhersager durch einen Transformer, der eine bessere Zeitmodellierung und -skalierung auf langer Reichweite ermöglicht. Bei komplexen Aufgaben (30+ Sekunden-Episoden) übertreibt DP-T die CNN-basierte Variante um ~8% die Erfolgsrate, erfordert aber mehr Berechnung und Daten.
Die Schlussfolgerung: Entscheidungsträume
Folgen Sie diesem Entscheidungsprozess:
- Wenn Bimanuelle Manipulation → ACT (oder ACT+)
- Wenn unter 100 Demo → ACT
- Wenn Nutzen < 10ms Abschluß → ACT
- Wenn die Task eine multimodale Aktionsverteilung (mehrere gültige Anschläge, Annäherungswinkel) hat → Diffusionspolitik
- Wenn dextre Handkontrolle (5+ Finger DoF) → Diffusionspolitik
- Wenn **großer Datensatz (>500 Demo) ** und Skalierung → Diffusionspolitik
- Wenn Sie sich nicht sicher sind → trainieren Sie beide auf einem 50-Demo-Pilot-Split und vergleichen; Budget ~ 2 Tage der Berechnung
Überlegungen zur Datenerhebung
Für einen oder anderen Algorithmus ist die Demonstrationsqualität wichtiger als die Wahl der Algorithmen für kleine Datenregime (<200 Demos).
Für Hardware: ACT wurde um ALOHA (low-cost bimanual) entwickelt.
ACT-Modellseite → Diffusion Policy Model Page → VLA-Modelle Vergleich →
Das Lesen über die Bewertung ist eine Sache
Run a real-world eval → Kommission Evaluation Daten → Hardware für Ihre Evaluation Rig →







