Aktionsschnupfen gegen Vollbahnnachahmung: Ein praktischer Vergleich
Wenn man Action Chunking (ACT) gegen Verhaltensklonung in der gesamten Bahn nutzt, sind Latenz, Aufgabenhorizont und Trainingsinplikationen zu berücksichtigen.
[← Forschung]
Verstehen, wann man Aktionsstücke gegenüber ganzen Bahnen vorhersagen soll
Das Problem mit der Klonierung naives Verhalten
Standard-Verhaltenskloning (BC) bildet eine Politik πa
Erstens ** Kompoundungsfehler**: Kleine Vorhersagefehler verschieben den Roboter in etwas unbekannte Zustände, die größere Fehler verursachen, die den Zustand weiter verschieben
Zweitens modus-durchschnitt: Wenn für eine und dieselbe Aufgabe mehrere gültige Strategien vorhanden sind (z.B. das Erfassen eines Objekts von links oder rechts), durchschnittst eine unmodal BC-Politik die Demonstrationen und erzeugt eine Zwischenbahn, die keine der beiden Strategien erfolgreich ausführt.
Was ist Action Chunking?
Die Aktions-Chunking, die im ACT-Papier (Zhao et al., 2023) eingeführt wurde, behebt Fehler bei der Kompilierung, indem sie eine sequenz von H-Zukunftsmaßnahmen aus der aktuellen Beobachtung vorhergesagt und dann die ersten k-Aktionen vor der erneuten Abfrage der Politik ausgeführt wird.
Die Politik π(a_{t:t+H} ➡ s_t) liefert einen Haufen von H-Aktionen auf einmal. Bei H=100 bei 50 Hz-Steuerung umfasst eine einzige Abfrage 2 Sekunden Bewegung.
- Teilgröße H: Die Anzahl der künftigen Zeitschritte, die in einer einzigen Abfrage vorhergesagt werden. Bei einer Tabelle-Manipulation bei 50 Hz ist H = 100 (2 Sekunden) die Standard-ACT-Konfiguration.
- Wiederplanungsfrequenz k: Die Anzahl der vor der erneuten Abfrage der Politik ausgeführten Aktionen. In ACT k=H/4 bis H (vollständige Teil-Ausführung ohne Neuplanung).
- CVAE-Coder: ACT verwendet einen Bedingten Variations-Autocoder, um den Stil/Modus der gesamten Demonstration zu kodieren, so dass sich die Politik an eine Strategie verpflichtet, anstatt sich zu durchschnittlich zu halten.
Diffusionspolitik: Vernichtung durch Verkleinern
Diffusion Policy (Chi et al., 2023) erreicht eine ähnliche Multi-Modalitätsbearbeitung durch einen anderen Mechanismus: Modellierung der Aktionsverteilung als Diffusionsprozess über einen Stück Aktionen.
- U-Net-Difusion: Ein konvolutionsnaher U-Net bezeichnet Aktionsstücke. Schneller abzuleiten (~10
50 ms auf GPU) als Transformator-basierte Diffusion. - Transformatordiffusion: Besser bei der Erfassung von langfristigen Abhängigkeiten in Aktionssequenzen. Langsamer (~100
300 ms). - Typische Stückgröße: H=8
16 für 10 Hz-Kontrolle; H=32 64 für 50 Hz-Kontrolle.
Aufgabe Horizontanalyse
Die richtige Stückgröße und die Frequenz der Neuplanung hängen stark vom Aufgabenhorizont ab:
- ** Kurzhorizont-Aufgaben (<3 Sekunden):** Einfache Pick-and-Place-Stapelung. BC funktioniert oft ausreichend. Wenn ACT verwendet wird, deckt H=50
100 bei 50 Hz die gesamte Aufgabe in einer oder zwei Abfragen ab. - ** Mittlere Horizont-Aufgaben (3
15 Sekunden):** Steckverfügung, Kabelverbindung, Lebensmittelmontage. Dies ist der Schatzpunkt der ACT. H=100 umfasst 2 Sekunden; die Neuplanung alle 25 50 Schritte (0,5 1 Sekunde) hält die Politik reaktiv. - Langzeitarbeiten (> 30 Sekunden): Vollständige Kocharbeiten, Multi-Träger-Versammlung, Raumorganisation. Einfach-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil VLMs wie RT-2 oder OpenVLA verarbeiten die Auflösung von Aufgaben auf hoher Ebene; ACT oder Diffusion verarbeiten die Ausführung auf niedriger Ebene.
Schulungsdatenanforderungen
Chunking ändert Ihre Datenanforderungen auf subtile Weise:
- Zeitliche Kohärenz: Action Chunking geht davon aus, dass aufeinanderfolgende Zeitschritte in einer Demonstration Teil eines kohärenten Plans sind. Zögerungen, Korrekturen und Rückverfolgung innerhalb einer Demonstration verwirren den Chunk-Prediktor. Für laute Aufgaben erfordert Action Chunking etwa 2x mehr Daten als BC, um die gleiche Leistung zu erzielen, da ein größerer Teil der Demos hochwertig sein muss.
- Multimodal-Abdeckung: CVAE in ACT erfordert mindestens 20
30 Demonstrationen jeder einzelnen Strategie, um einen sauberen latenten Modus zu lernen. - **Episodelänge Normalisierung:**Episoden mit variabler Länge schaffen Herausforderungen für die Vorhersage von festen Stückchen.
Leistungsbezogene Benchmarks
| Algorithm | ALOHA Insertion | ALOHA Transfer Cube | ALOHA Slot Battery | Inference Latenz |
|---|---|---|---|---|
| Verhaltensklonen | 45% | 62% | 30% | 2–5 ms |
| ACT (H=100) | 80% | 92% | 65% | 15–30 ms |
| Diffusion Policy (U-Net) | 76% | 88% | 60% | 10–50 ms |
| Diffusion Policy (Transformer) | 82% | 91% | 68% | 100–300 ms |
| ACT + temporal ensemble | 83% | 94% | 70% | 20–40 ms |
Die Ergebnisse sind aus dem Original ACT-Papier (Zhao et al., 2023) und Chi et al. (2023) über den ALOHA-Bimanual-Manipulation-Benchmark erfasst.
Für Empfehlungen, welche Algorithmen Ihrer Aufgabe und Datenlage entsprechen, siehe [RCSV-Schulungsplattform]
Empfehlungen nach Aufgabenart
| Task Type | Recommended Algorithm | Chunk Size | Notes |
|---|---|---|---|
| Simple pick-and-place | BC or ACT | N/A or H=50 | BC sufficient if single strategy |
| Präzision insertion | ACT or Diffusion-T | H=100 | Multi-modality in approach angle |
| Bimanual coordination | ACT | H=100–200 | Joint state space required |
| Long-horizon (>30s) | Hierarchical (VLM + ACT) | H=50–100 per subtask | Subtask decomposition required |
| Deformable objects | Diffusion Policy | H=32–64 | Diffusion handles uncertainty better |
| High-speed (>5 Hz query) | BC or U-Net Diffusion | H=8–16 | Transformer diffusion too slow |
Schulen Sie Ihre Politik auf der RCSV-Plattform
Die RCSV-Schulplattform unterstützt BC, ACT, Diffusionspolitik und OpenVLA-Finionierung mit automatischer Hyperparametersuche.







