ACT vs. Diffusion: Ein praktisches Leitfaden zur Wahl des richtigen Algorithmus
Wenn Action Chunking mit Transformern (ACT) vs. Diffusion Policy für Robotermanipulation verwendet werden <unk> Latenz, Aufgabenkomplexität und Schulungsdaten-Tradeoffs.
Teil von: [Handbuch zum Nachbilden]
[← Blog]
Die Wahl des Algorithmus ist weniger wichtig als die Datenqualität, aber es ist wichtig genug, um richtig zu sein.
Kurze Zusammenfassung
ACT (Action Chunking with Transformers, Zhao et al. 2023) verwendet ein CVAE, um Action-Bündel
Inferenz-Latenz: Die praktische Einschränkung
Für die Echtzeit-Roboterkontrolle ist die Ableitlatenz eine harte Einschränkung, die oft die Wahl des Algorithmus vor jeder anderen Überlegung bestimmt.
| Algorithm | Inference Time | Control Hz | Notes |
|---|---|---|---|
| ACT | 50 ms | 20 Hz | Executes 20-step chunks; real inference rate much lower |
| Diffusion Policy (DDPM) | 500 ms | 2 Hz | Too slow for reactive tasks without chunking |
| Diffusion Policy (DDIM 10 steps) | 200 ms | 5 Hz | Acceptable for slow manipulation |
| Consistency Policy | 50 ms | 20 Hz | Single denoising step; matches ACT latency |
| ACT + temporal ensemble | 50 ms | 20 Hz | Smoothing across multiple chunk predictions |
Wenn Ihre Aufgabe eine reaktive Hochfrequenzsteuerung erfordert (Fangen, Gießen, Hochgeschwindigkeitsmontage), ist die Standard-Difusion Policy DDPM einfach zu langsam. Verwenden Sie ACT oder Konsistenzpolitik. Wenn Ihre Aufgabe eine langsame, präzise Manipulation beinhaltet, bei der 200ms-Latenz akzeptabel ist, ist die DDIM-Difusion-Politik praktikabel und kann bessere Ergebnisse erzielen.
Empfehlungen für Aufgabenarten
- Schnelle Reaktionsarbeiten (Fang, Rührung, Hochgeschwindigkeits-Pick-Place): ACT oder Konsistenzpolitik. Die 20Hz-Steuerungshäufigkeit ermöglicht Echtzeit-Anpassung. Diffusion DDPM bei 2Hz kann nicht auf bewegende Objekte reagieren.
- ** Präzisionsarbeiten mit mehreren praktikablen Lösungen (Peg-in-Hole, USB-Einsetzung, Stoffklapp):** Diffusionspolitik.
- ** Langhorizont-Aufgaben über 10 Schritte:** Kein Algorithmus allein reicht aus. Verwenden Sie hierarchische Richtlinien: Ein Aufgabenplaner wählt die Teilaufgabensequenzen aus, dann führt ACT oder Diffusion Policy einzelne Teilaufgaben aus.
- ** Aufgaben, bei denen die Position des Objekts erheblich variiert:** Beide funktionieren, aber die Diffusion Policy neigt dazu, sich besser auf neue Objektspositionen zu verallgemeinern, wenn sie mit ausreichenden Daten ausgebildet sind.
Schulungsdatenanforderungen
| Algorithm | Minimum Demos | Recommended | Training Time (single GPU) |
|---|---|---|---|
| ACT | 50 | 100–500 | 2–4 hours |
| Diffusion Policy (DDPM) | 200 | 500–2000 | 6–12 hours |
| Consistency Policy | 100 | 300–1000 | 4–8 hours |
Die geringere Datenanforderung von ACT ist ein echter Vorteil für die Erforschung neuer Aufgaben, wo die Sammlung von mehr als 500 Demos teuer ist. Die Diffusion Policy überholt jedoch oft ACT, wenn mehr Daten zur Verfügung stehen.
Hyperparameter Empfindlichkeit
Der kritische Hyperparameter des ACT ist das KL-Divergenzgewicht im CVAE-Verlust. Zu niedrig: der latente Raum kollabiert und die Politik ignoriert den Kontext. Zu hoch: die Politik ignoriert Demonstrationen und regriert auf das Mittel. Standardempfehlung: Beginnen Sie bei 10 und durchsuchen Sie 1, 5, 10, 50 auf einem kleinen Datensatz vor der vollständigen Ausbildung.
Die Diffusionspolitik ist empfindlicher gegenüber Lernrate- und Lärmvarianztischeln. Die ursprüngliche DDPM-Implementierung verwendet einen Kosinus-Lärm-Schedule mit linearer Warmup LR; diese Standardfunktionen funktionieren in der Praxis gut. Der häufigste Fehler ist die Verwendung einer zu hohen Lernrate (>3e-4 mit Adam), die die Ausbildung Instabilität auf Kontakt-reich Daten verursacht.
Entscheidungsträger
| Condition | Recommended Algorithm |
|---|---|
| < 200 demos available | ACT |
| Reactive/high-speed task | ACT or Consistency Policy |
| Präzision with multi-modal solutions | Diffusion Policy |
| > 500 demos, slow task | Diffusion Policy |
| Deployment on low-compute hardware | ACT (lighter model) |
| Want to use HuggingFace LeRobot | Both supported |
Beide Algorithmen sind als Referenzimplementierungen in der RCSV [Datenplattform] (
Unter dem Hut: ACT Architektur
ACT (Action Chunking with Transformers) kombiniert ein CVAE (Conditional Variational Autoencoder) mit einer Transformatorarchitektur, um Aktionsstücke zu prognostizieren - Sequenzen von 20-100 zukünftigen Aktionen aus einer einzigen Beobachtung.
Encoder: Der visuelle Encoder verarbeitet Kamerabilder über ein vorgeübtes Rückgrat (typischerweise ResNet-18 oder eine ViT-Variante). Der gemeinsame Zustand (Proprioception) wird mit den visuellen Merkmalen verknüpft. Die kombinierte Beobachtung wird an einen Transformator-Encoder gespeist, der eine Kontext-Einbetätigung erzeugt.
CVAE: Während des Trainings nimmt der CVAE-Encoder die Grundwahrheit-Aktionssequenz und die Beobachtung ein, um eine latente Variable z zu erzeugen. Während der Abschlussung wird z aus dem gelernten Vorgang (nur auf der Beobachtung bedingt) geprobt. Die KL-Divergenzzeit im CVAE-Verlust sorgt dafür, dass die vorherigen und nachträglichen Verteilungen nahe bleiben und es zur Zeit der Prüfung möglich ist, Probenahme von der vorherigen zu erstellen.
Decoder: Der Transformator-Decoder nimmt die Kontext-Einbetten und den latenten z und generiert autoregressiv den Aktionsteil. Jede Ausgangsposition prognostiziert eine Aktion (typischerweise 7D: 6D End-Effektor Delta + 1D-Greifer). Der vollständige Teil wird in einem einzigen Vorwärtspass generiert (nicht iterativ wie Sprachmodell-Token), weshalb ACT eine 50ms-Förderung erreicht.
Zeitliches Ensemble: Bei der Bereitstellung erzeugt ACT bei jedem erneuten Beobachtungsschritt überlappende Aktionsstücke und durchschnittliche Überlappungen der vorhergesagten Aktionen mit exponentieller Gewichtung (kürzliche Vorhersagen mit höherem Gewicht). Dies vereinfacht die Übergangszeit zwischen den Stücken und reduziert die Nervenkitzel an den Stückgrenzen. Der ensemble-gewichtverfallparameter (typischerweise 0,01) steuert den tradeoff zwischen glatzheit und reaktionsfähigkeit.
Unter dem Hut: Diffusionpolitik Architektur
Die Diffusion Policy wendet das DDPM (Denoising Diffusion Probabilistic Model) -Rahmenwerk zur Roboter-Aktionsvorhersage an. Statt Bilder aus Lärm (wie in Bilddiffusionmodellen) zu erzeugen, erzeugt es Aktionssequenzen aus Lärm.
** Weiterentwicklung:** Während des Trainings wird Lärm der Grundwahrheit-Aktionssequenz über T-Diffusionsschritte (typischerweise T=100 für DDPM) nach und nach hinzugefügt.
Netzwerk Architektur: Das Bezeichnungsnetz kann entweder ein 1D-U-Net (konvolutionär, das über die zeitliche Dimension der Aktionssequenz arbeitet) oder ein Transformator sein. Beide nehmen als Eingabe: die laute Aktionssequenz, den Diffusionszeitstufen t (kodiert als sinusförmige Einbeziehung) und die Beobachtungskodierung aus dem visuellen Rückgrat.
Inferenz: Abgerufen aus reinem Lärm, wird das Modell iterativ über T-Schritte hinweg denoisiert, um eine saubere Aktionssequenz zu erzeugen. Die Konsistenzdestillation verringert den gesamten Entzündungsprozess in einem einzigen Schritt und entspricht der Ableitgeschwindigkeit des ACT mit zusätzlicher Schulungskomplexität.
Multi-Modalität: Der Kernvorteil der Diffusionspolitik gegenüber ACT ist die explizite multimodelle Aktionsverteilungszusammenstellung. Wenn eine Aufgabe mehrere gültige Strategien hat (Ansatz von links gegen rechts, Greifen von oben gegen Seite), kann das Diffusionsmodell alle gültigen Modi in der gelernten Verteilung darstellen. Die CVAE von ACT kann auch mehrere Modi durch den latenten Raum repräsentieren, aber die KL-Regulierung neigt in der Praxis dazu, Modi zu kollabieren, insbesondere bei begrenzten Trainingsdaten.
Hybrid-Ansätze: Kombination von ACT und Diffusionspolitik
Es gibt verschiedene Hybridansätze, die die Stärken beider Algorithmen kombinieren:
- DP-T (Diffusion Policy Transformer): Ersetzt das U-Net-Denoising-Netz durch einen Transformer, der mit der Länge der Aktionssequenz und der Beobachtungskomplexität bessere Skalierung erhält. DP-T mit DDIM 10-Schritt-Abschluss erreicht eine Latenz von 100 ms (zwischen ACT und Standard DP) mit multimodale Aktionsvorhersage. Dies ist zunehmend die Standardwahl für Teams mit ausreichender Rechenleistung.
- ** Konsistenzpolitik:** Distillt eine ausgebildete Diffusionspolitik in einen Ein-Schritt-Generator mit Konsistenz-Training. Das Ergebnis entspricht der 50ms-Abschluss der ACT und behält gleichzeitig die multimodal-Aktionsverteilung der Diffusionspolitik.
- ACT mit mehrköpfigen Vorhersagen: Verwenden Sie statt eines einzigen CVAE-Decoders K-Decoder-Heads, die jeweils einen anderen Aktionsteil vorhersagen. Bei der Abschlussung wählen Sie den Kopf aus, dessen vorhergesagter Teil den niedrigsten Rekonstruktionsfehler gegenüber der jüngsten Beobachtung hat. Dies liefert diskrete Multi-Modalität (K-Modus) bei der Abschlussgeschwindigkeit auf ACT-Ebene.
- Hierarchische DP + ACT: Nutzen Sie die Diffusionspolitik für die Auswahl von Fähigkeiten auf hoher Ebene (die Strategie erfassen, die Richtung annähern) bei niedriger Frequenz (1-2 Hz) und ACT für die Ausführung von Flugbahn auf niedriger Ebene bei hoher Frequenz (20 Hz).
Referenzbenchmarks nach Hardware-Plattform
Die Bereitstellung von Hardware bestimmt, welcher Algorithmus praktikabel ist. Diese Benchmarks verwenden die Standardmodellgrößen (ACT: ResNet-18 Backbone + 4-Schicht-Transformator, ~25M Param; Diffusionspolitik: ResNet-18 + 1D U-Net, ~55M Param; Konsistenzpolitik: dieselbe Architektur wie DP, distilliert bis zu einem Schritt).
| Algorithm | RTX 4090 | RTX 3060 | Jetson Orin (64GB) | Jetson Orin Nano | Apple M2 (MPS) | CPU (i7-13700) |
|---|---|---|---|---|---|---|
| ACT (chunk=50) | 12 ms / 83 Hz | 35 ms / 28 Hz | 50 ms / 20 Hz | 120 ms / 8 Hz | 65 ms / 15 Hz | 180 ms / 5.5 Hz |
| ACT (chunk=100) | 18 ms / 55 Hz | 50 ms / 20 Hz | 75 ms / 13 Hz | 180 ms / 5.5 Hz | 95 ms / 10 Hz | 280 ms / 3.5 Hz |
| DP (DDPM, 100 steps) | 150 ms / 6.6 Hz | 420 ms / 2.4 Hz | 600 ms / 1.7 Hz | 1800 ms / 0.6 Hz | 550 ms / 1.8 Hz | 4200 ms / 0.2 Hz |
| DP (DDIM, 10 steps) | 22 ms / 45 Hz | 65 ms / 15 Hz | 100 ms / 10 Hz | 280 ms / 3.6 Hz | 85 ms / 12 Hz | 650 ms / 1.5 Hz |
| DP-T (DDIM, 10 steps) | 28 ms / 35 Hz | 80 ms / 12.5 Hz | 120 ms / 8 Hz | 350 ms / 2.9 Hz | 105 ms / 9.5 Hz | 820 ms / 1.2 Hz |
| Consistency Policy | 15 ms / 66 Hz | 45 ms / 22 Hz | 70 ms / 14 Hz | 200 ms / 5 Hz | 60 ms / 16 Hz | 350 ms / 2.9 Hz |
** Schlüsselbeobachtungen:** DDPM Diffusion Policy ist für alles unterhalb einer Desktop-GPU unbrauchbar. DDIM mit 10 Schritten bringt DP in praktisches Gebiet auf Jetson Orin (10 Hz reicht für die meisten Manipulationsarbeiten aus). ACT ist der einzige Algorithmus, der mit akzeptabler Geschwindigkeit auf Jetson Orin Nano (8 Hz mit Chunk=50) läuft. Die Konsistenzpolitik entspricht der ACT-Geschwindigkeit und behält die multimodaligen Eigenschaften von DP bei, was sie zur besten Option für die mittlere Hardware macht - wenn Sie sich die zusätzliche Trainingszeit leisten können.
Für mobile Roboter (Unitree G1, Mobile ALOHA-Plattformen bei RCSV) ist Jetson Orin das Standard-Rechenmodul. Dies bedeutet, dass Ihre praktischen Entscheidungen ACT, DDIM DP oder Konsistenzpolitik sind. DDPM DP ist nur mit einer Desktop-GPU via Netzwerk vernetzt (zufügt 5-15ms Netzwerk Latenz, die für langsame Aufgaben akzeptabel ist).
Vergleiche der Ausbildungswirksamkeit
Die Schulungskosten hängen von der Größe des Datensatzes, der GPU-Hardware und dem Algorithmus ab. Diese Benchmarks verwenden einen Standard-Setup: 2-Kamera-Eingabe (224x224), 7-DOF-Aktionsraum, einzelne NVIDIA-GPU.
| Scenario | ACT (A100) | ACT (RTX 3060) | DP (A100) | DP (RTX 3060) | CP (A100) |
|---|---|---|---|---|---|
| 100 demos, 2K epochs | 45 min | 2.5 hr | 2 hr | 8 hr | 4 hr* |
| 500 demos, 2K epochs | 3 hr | 12 hr | 8 hr | 36 hr | 16 hr* |
| 2000 demos, 3K epochs | 18 hr | 72 hr | 48 hr | 8+ days | 96 hr* |
| Cloud cost estimate (above) | $35 | N/A (local) | $95 | N/A (local) | $190* |
Das Programm "Konsistenzpolitik" umfasst die Basis-DP-Ausbildung + Konsistenzdestillation.
ACT ist für dieselbe Datensatzgröße 3-4x schneller als die Diffusion Policy, was bei der schnellen Prototypisierung bei der Iteration von Datenerfassungstrategie und Hyperparametern erheblich wichtig ist. Bei 500 Demo-Studien auf einem lokalen RTX 3060 sind das 5 bis 10 Tage Training für ACT gegenüber 15 bis 30 Tagen für DP. Dies allein rechtfertigt den Einstieg mit ACT für die Erstarbeitsexploration und dann den Wechsel zu DP, sobald die Datenerhebung abgeschlossen ist und Sie maximale Leistung wollen.
Vergleiche der Erfolgsraten auf Aufgabenebene
Alle Richtlinien wurden für jede Aufgabe auf demselben Demonstrationsdatensatz ausgebildet. Erfolg = innerhalb von 2x der Demonstrationszeit ausgefüllte Aufgabe.
| Task | Demos | ACT | DP (DDIM) | CP | Winner |
|---|---|---|---|---|---|
| Pick cube (single position) | 50 | 92% | 85% | 88% | ACT |
| Pick cube (random position) | 200 | 78% | 84% | 82% | DP |
| Peg insertion (tight fit, 1mm) | 300 | 55% | 72% | 68% | DP |
| Bimanual handover | 200 | 75% | 70% | 72% | ACT |
| Cloth folding | 500 | 40% | 62% | 58% | DP |
| Pour liquid (speed-critical) | 150 | 68% | 52% | 65% | ACT |
| Stack 3 blocks (sequential) | 400 | 35% | 48% | 45% | DP |
Muster: ACT gewinnt bei Aufgaben, die Geschwindigkeit erfordern (Vergießen, Übergabe) und mit kleinen Datensätzen (einzelne Position-Auswahl mit 50 Demos). DP gewinnt bei Aufgaben mit Präzision (Peg-Einsetzen), Aufgaben mit hoher Varianz (zufällige Positionen, Stoffklappung) und Aufgaben mit längerer Horizont (Blockstackung). Die Lücke schrumpft mit zunehmender Datensatz. Mit 1000+ Demos überträgt DP konsequent ACT in allen Aufgabenarten.
Häufige Fehler und Fehlerbehebung
Beide Algorithmen scheitern auf vorhersehbare Weise. Wenn Sie das Fehlermuster erkennen, wissen Sie, ob die Lösung mehr Daten, verschiedene Hyperparameter oder ein völlig anderer Algorithmus ist.
ACT-spezifische Ausfälle
- Modusdurchschnitt (Törperschwingung in der Nähe des Kontakts): Die Politik durchschnittlich zwei gültige Strategien (Ansatz von links gegen rechts) produziert eine Bahn, die nirgendwohin geht.
- Mehrzahlgrenz-Unterläufe (auf jeden N-Schritt plötzlich zerrüttet): Das temporäre Ensemble ist nicht ausreichend glatz zwischen aufeinanderfolgenden Stückchen.
- Drift bei langen Aufgaben (> 15 Sekunden): ACT hat keinen expliziten Mechanismus zur Korrektur von akkumulierten Fehlern über lange Horizonte. Die Richtlinie prognostiziert Open-Loop-Bündel, die langsam von der vorgesehenen Bahn abweichen.
Diffusionspolitik-spezifische Fehler
- Slow Reaktion auf Störung: Mit 100-Schritt-DDPM kann die Richtlinie nicht auf unerwartete Ereignisse (Objekt-Slips, menschliches Eingreifen) für 500 ms reagieren.
- Training-Kollaps (Verlustspikes, NaN-Gradieenten): Häufig bei Lernraten über 3e-4 oder Batchgrößen unter 32.
- ** Überglatte Bahnen (Der Greifer öffnet/schließt zu langsam):** Der Diffusions-Deno-Prozess verflachtet natürlich die Aktionsverteilung, wodurch scharfe Greiferübergangsvorgänge abgerundet werden können.
ONNX Export und TensorRT Optimierung
Für die Bereitstellung auf Edge-Hardware profitieren sowohl ACT als auch DP erheblich von ONNX-Export- und TensorRT-Optimierung.
# export_act_onnx.py -- Export ACT zu ONNX für TensorRT Import Torch von lerobot.common.policies.act.modeling_act import ACTPolitik # Load trained checkpoint policy = ACTPolitik.from_pretrained("Pfad/zu/Checkpoint") policy.eval() # Erstellen Sie dummy-Inputs, die Ihrem Beobachtungsraum entsprechen Dummy_obs = { "Beobachtungsbilder.images.top": torch.randn(1, 3, 224, 224), "Beobachtungsbilder.images.wrist": torch. \n(1, 3, 224, 224), "Beobachtungsbilder.state": torch.randn1, 14), # 7-DOF-Griff x-set } # Export zu NX.ch.ch.ch.onch.exportpolitik "\" , \\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\
Die Optimierung von TensorRT FP16 ermöglicht in der Regel eine 2-3x höhere Geschwindigkeit als PyTorch auf Jetson-Hardware. Für ACT auf Jetson Orin bringt dies die Schlussfolgerung von 50ms auf 18-22ms. Für DDIM DP von 100ms auf 35-45ms. Die Quantifizierung von FP16 hat eine vernachlässigbare Auswirkungen auf die Qualität der Politik für beide Algorithmen (weniger als 1% Erfolgsrate in unseren Tests).
Schulungsschläge für beide Algorithmen
# Common training configuration patterns for LeRobot
# ACT config (lerobot/configs/policy/act.yaml)
# Key hyperparameters to tune:
# chunk_size: 50-100 (longer = smoother but less reactive)
# kl_weight: 10 (sweep: 1, 5, 10, 50)
# lr: 1e-4 (reduce to 5e-5 if training is unstable)
# batch_size: 32-64
# n_epochs: 2000 (for 200 demos; scale proportionally)
# Diffusion Policy config (lerobot/configs/policy/diffusion.yaml)
# Key hyperparameters:
# n_diffusion_steps: 100 (DDPM) or 10 (DDIM at inference)
# prediction_type: "epsilon" (noise prediction; more stable than "sample")
# lr: 1e-4 with cosine schedule
# batch_size: 64-128 (DP benefits from larger batches more than ACT)
# n_epochs: 3000 (for 200 demos; DP converges slower than ACT)
# Both algorithms:
# - Use action normalization (zero mean, unit variance per dimension)
# - Use image augmentation (random crop 84-96%, color jitter)
# - Monitor validation loss every 50 epochs; save best checkpoint
# - EMA (exponential moving average) of weights at 0.9999 decay
Verwandte Lesungen
- [Ausbildungsschulden für Roboter: Von der Demonstration bis zur Bereitstellung]
- [LeRobot-Framework: Startleitfaden]
- [Roboterpolitik Generalisierung: Warum Ihr Roboter bei neuen Objekten versagt]
- [Skalierungsgesetze für Roboterlernen: Was wissen wir in 2026]
- [Roboter-Lernen: Kosten pro Demonstrationsanalyse]
- [RCSV-Datenerhebung]
- [RCSV-Datenplattform]
Erstmalige Politik zur RCSV-Infrastruktur
Die RCSV-Plattform bietet vorgebaute ACT- und Diffusionpolitik-Schulungskonfigurationen, Datensatzmanagement und Bewertungstools.
[Erforschen Sie die Plattform]







