Zurück zu Research

Aktionsschnupfen gegen Vollbahnnachahmung: Ein praktischer Vergleich

Wenn man Action Chunking (ACT) gegen Verhaltensklonung in der gesamten Bahn nutzt, sind Latenz, Aufgabenhorizont und Trainingsinplikationen zu berücksichtigen.

[← Forschung]

Verstehen, wann man Aktionsstücke gegenüber ganzen Bahnen vorhersagen soll und wie sich die Wahl auf die Roboterleistung, die Trainingskosten und die Bereitstellungsabläufe auswirkt.

Das Problem mit der Klonierung naives Verhalten

Standard-Verhaltenskloning (BC) bildet eine Politik πa

Erstens ** Kompoundungsfehler**: Kleine Vorhersagefehler verschieben den Roboter in etwas unbekannte Zustände, die größere Fehler verursachen, die den Zustand weiter verschieben was zu einem katastrophalen Ausfall führt, lange bevor die Aufgabe abgeschlossen ist. Dies ist das klassische DAgger-Problem. In der Praxis gelingt es den BC-Politikern für die Aufgaben auf dem Tisch oft bei 80% bei der Ausführung von Schulungen (die weiterhin auf der Verteilung) zu gelingen, scheitert aber bei 4050% bei der Ausführung derselben Aufgabe.

Zweitens modus-durchschnitt: Wenn für eine und dieselbe Aufgabe mehrere gültige Strategien vorhanden sind (z.B. das Erfassen eines Objekts von links oder rechts), durchschnittst eine unmodal BC-Politik die Demonstrationen und erzeugt eine Zwischenbahn, die keine der beiden Strategien erfolgreich ausführt.

Was ist Action Chunking?

Die Aktions-Chunking, die im ACT-Papier (Zhao et al., 2023) eingeführt wurde, behebt Fehler bei der Kompilierung, indem sie eine sequenz von H-Zukunftsmaßnahmen aus der aktuellen Beobachtung vorhergesagt und dann die ersten k-Aktionen vor der erneuten Abfrage der Politik ausgeführt wird.

Die Politik π(a_{t:t+H} ➡ s_t) liefert einen Haufen von H-Aktionen auf einmal. Bei H=100 bei 50 Hz-Steuerung umfasst eine einzige Abfrage 2 Sekunden Bewegung.

  • Teilgröße H: Die Anzahl der künftigen Zeitschritte, die in einer einzigen Abfrage vorhergesagt werden. Bei einer Tabelle-Manipulation bei 50 Hz ist H = 100 (2 Sekunden) die Standard-ACT-Konfiguration.
  • Wiederplanungsfrequenz k: Die Anzahl der vor der erneuten Abfrage der Politik ausgeführten Aktionen. In ACT k=H/4 bis H (vollständige Teil-Ausführung ohne Neuplanung).
  • CVAE-Coder: ACT verwendet einen Bedingten Variations-Autocoder, um den Stil/Modus der gesamten Demonstration zu kodieren, so dass sich die Politik an eine Strategie verpflichtet, anstatt sich zu durchschnittlich zu halten.

Diffusionspolitik: Vernichtung durch Verkleinern

Diffusion Policy (Chi et al., 2023) erreicht eine ähnliche Multi-Modalitätsbearbeitung durch einen anderen Mechanismus: Modellierung der Aktionsverteilung als Diffusionsprozess über einen Stück Aktionen.

  • U-Net-Difusion: Ein konvolutionsnaher U-Net bezeichnet Aktionsstücke. Schneller abzuleiten (~1050 ms auf GPU) als Transformator-basierte Diffusion.
  • Transformatordiffusion: Besser bei der Erfassung von langfristigen Abhängigkeiten in Aktionssequenzen. Langsamer (~100300 ms).
  • Typische Stückgröße: H=816 für 10 Hz-Kontrolle; H=3264 für 50 Hz-Kontrolle.

Aufgabe Horizontanalyse

Die richtige Stückgröße und die Frequenz der Neuplanung hängen stark vom Aufgabenhorizont ab:

  • ** Kurzhorizont-Aufgaben (<3 Sekunden):** Einfache Pick-and-Place-Stapelung. BC funktioniert oft ausreichend. Wenn ACT verwendet wird, deckt H=50100 bei 50 Hz die gesamte Aufgabe in einer oder zwei Abfragen ab.
  • ** Mittlere Horizont-Aufgaben (315 Sekunden):** Steckverfügung, Kabelverbindung, Lebensmittelmontage. Dies ist der Schatzpunkt der ACT. H=100 umfasst 2 Sekunden; die Neuplanung alle 2550 Schritte (0,51 Sekunde) hält die Politik reaktiv.
  • Langzeitarbeiten (> 30 Sekunden): Vollständige Kocharbeiten, Multi-Träger-Versammlung, Raumorganisation. Einfach-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil-Teil VLMs wie RT-2 oder OpenVLA verarbeiten die Auflösung von Aufgaben auf hoher Ebene; ACT oder Diffusion verarbeiten die Ausführung auf niedriger Ebene.

Schulungsdatenanforderungen

Chunking ändert Ihre Datenanforderungen auf subtile Weise:

  • Zeitliche Kohärenz: Action Chunking geht davon aus, dass aufeinanderfolgende Zeitschritte in einer Demonstration Teil eines kohärenten Plans sind. Zögerungen, Korrekturen und Rückverfolgung innerhalb einer Demonstration verwirren den Chunk-Prediktor. Für laute Aufgaben erfordert Action Chunking etwa 2x mehr Daten als BC, um die gleiche Leistung zu erzielen, da ein größerer Teil der Demos hochwertig sein muss.
  • Multimodal-Abdeckung: CVAE in ACT erfordert mindestens 2030 Demonstrationen jeder einzelnen Strategie, um einen sauberen latenten Modus zu lernen.
  • **Episodelänge Normalisierung:**Episoden mit variabler Länge schaffen Herausforderungen für die Vorhersage von festen Stückchen.

Leistungsbezogene Benchmarks

Algorithm ALOHA Insertion ALOHA Transfer Cube ALOHA Slot Battery Inference Latenz
Verhaltensklonen 45% 62% 30% 2–5 ms
ACT (H=100) 80% 92% 65% 15–30 ms
Diffusion Policy (U-Net) 76% 88% 60% 10–50 ms
Diffusion Policy (Transformer) 82% 91% 68% 100–300 ms
ACT + temporal ensemble 83% 94% 70% 20–40 ms

Die Ergebnisse sind aus dem Original ACT-Papier (Zhao et al., 2023) und Chi et al. (2023) über den ALOHA-Bimanual-Manipulation-Benchmark erfasst.

Für Empfehlungen, welche Algorithmen Ihrer Aufgabe und Datenlage entsprechen, siehe [RCSV-Schulungsplattform]T1) oder [Grundlagenmodellumfrage]T2).

Empfehlungen nach Aufgabenart

Task Type Recommended Algorithm Chunk Size Notes
Simple pick-and-place BC or ACT N/A or H=50 BC sufficient if single strategy
Präzision insertion ACT or Diffusion-T H=100 Multi-modality in approach angle
Bimanual coordination ACT H=100–200 Joint state space required
Long-horizon (>30s) Hierarchical (VLM + ACT) H=50–100 per subtask Subtask decomposition required
Deformable objects Diffusion Policy H=32–64 Diffusion handles uncertainty better
High-speed (>5 Hz query) BC or U-Net Diffusion H=8–16 Transformer diffusion too slow

Schulen Sie Ihre Politik auf der RCSV-Plattform

Die RCSV-Schulplattform unterstützt BC, ACT, Diffusionspolitik und OpenVLA-Finionierung mit automatischer Hyperparametersuche.

Erforschen Sie die Plattform →