Zurück zu Learn

Trajektorierepräsentation im Roboternutzen: Gemeinsame Raum, Aufgabenraum und Deltas

Wie Roboterbahnen in Lernalgorithmen gespeichert und dargestellt werden <unk> gemeinsame Winkel, kartesische Posen, Delta-Aktionen und relative Darstellungen.

[← Lernen]

Die Art und Weise, wie Sie Roboterbahnen darstellen, prägt, was Ihre Politik lernen kann und wie gut sie sich verallgemeint.

Was ist eine Roboterbahn?

Eine Roboterbahn ist die Reihenfolge von Zuständen und Aktionen, die während einer Episode des Roboterbetriebs aufgezeichnet wurden. Formal: T0, wo T1 die vollständige Sensorbeobachtung im Zeitschritt T2 (Kamerabilder + Gelenkzustände + Kraftwerte) und T3 die getätigte Aktion ist.

Die Maßnahmen, die die Politik ergreifen muss, sind für die Ausbildung die Handlungsfolge. "Aktion" ist jedoch kein einheitliches universelles Format es hängt von Ihren Entwurfsentscheidungen ab, und diese Entscheidungen haben erhebliche Folgen für die Verallgemeinerung der Politik und die Schwierigkeiten der Ausbildung.

Gemeinsame Raumfahrtvertretung

Die direkteste Darstellung: Die Aktion T4 ist ein Vektor von absoluten Gelenkswinkeln T5. Der Roboter-Controller erhält Gelenkswinkelziele und treibt jedes Gelenks zur belegten Position.

  • Vorteile: Keine IK erforderlich Winkel gehen direkt zu den Motorcontrollern. Deterministisch: dieselbe Aktion erzeugt immer die gleiche gemeinsame Konfiguration.
  • ** Nachteile:** Arm-spezifisch. Eine auf einem 6-DOF-Arm ausgebildete Politik kann nicht ohne Umschulung auf einen 7-DOF-Arm übertragen werden, auch für die gleiche Aufgabe.
  • Standardverwendung: ALOHA und ACT verwenden als primäre Aktionsdarstellung einen absoluten gemeinsamen Raum.

Cartesianische Aufgabenfläche

Die Aktion T6 stellt die gewünschte End-Effektor-Position dar: T7 drei Positionskomponenten und ein Quaternion zur Orientierung.

  • Vorteile: Intuitiv Die Aktion spezifiziert direkt, wo sich der Endefektor befinden sollte.
  • ** Nachteile:** IK ist erforderlich, um auf gemeinsame Befehle umzugehen ergibt ein Lattenz- und Singularitätsrisiko. Die Rotationsdarstellung ist schwierig: Eulerwinkel haben eine Gimmelsperre (meiden sie), Quaternions sind kompakt, aber nicht einzigartig (Doppeldeckung von SO(3)).
  • Rotationsrepräsentation Note: Verwenden Sie in Code immer Quaternions (nicht Eulerwinkel). Für die Ausgänge von neuronalen Netzwerken betrachten Sie die 6D-Rotationsrepräsentation (die ersten beiden Spalten der Rotationsmatrix) es ist kontinuierlich und singularitätfrei.

Delta-Aktionen

Anstelle absoluter Ziele geben die Delta-Aktionen den change aus dem aktuellen Zustand an: T8 (Veränderung der gemeinsamen Winkel) oder T9 (Veränderung der kartesischen Pose).

  • ** Warum Delta-Aktionen leichter zu erlernen sind:** Die Größe der Delta-Aktionen ist klein und ungefähr konstant über eine Trajektorie hinweg.
  • ** Implizite Sicherheit:** Das Einschneiden von Delta-Aktionen auf eine maximale Größe begrenzt die Geschwindigkeit des Roboters eine wichtige Sicherheitsmerkmal.
  • Standardverwendung: Diffusion Policy, RT-1, Octo und die meisten VLA-Modelle verwenden als primärer Aktionsraum kartesische Delta-Aktionen.

Absolute gegen objektrelevante Repräsentationen

Eine grundlegende Frage der Allgemeinheit: Sollten Aktionen im Arbeitsraum des Roboters dargestellt werden oder bezogen auf das Manipulationsobjekt?

  • Absolute (Arbeitsraum-Framme): Aktionswerte hängen von der Position des Objekts im Arbeitsraum ab. Wenn die Tabelle 10 cm verschoben wird, wird die Politik gescheitert. Gutes für feste Einstellungen; schlecht für die Generalisierung.
  • Objekt-relative: Aktionen werden als Offset von der detektierten Objektposition ausgedrückt. Politik lernt "ab 5 cm über dem Objekt" statt "zu bewegen zu (0,3, -0,1, 0.15)". Erfordert eine zuverlässige Objektdetektion oder Posenbewertung, aber verallgemeinert sich dramatisch besser auf neue Tabellehöhen, Positionen und sogar neue Umgebungen.

Streckenlänge und Padding

Die Dauer der Aufgaben variiert: Ein einfaches Gehen kann 2 Sekunden dauern (100 Schritte bei 50Hz); eine mehrschrittliche Montage kann 30 Sekunden dauern (1500 Schritte).

  • Fixed-Length mit Polsterung: Pad kürzere Episoden auf maximale Länge mit einem speziellen "no-op" Aktions-Token. Verwenden Sie Aufmerksamkeitsmasken in Transformer-basierten Richtlinien, damit das Netzwerk Polsterung Token ignoriert. Einfach umzusetzen.
  • Variable-Länge mit Maskierung: Prozess jede Episode nach ihrer natürlichen Länge.
  • Action Chunking: ACT-Stil: Brechen Sie die Bahn in Stück mit fester Länge (z.B. 100 Schritte) und trainieren Sie sich selbständig auf Stück.

Vergleiche der Repräsentationen

Representation Intuitive Generalizable IK Needed Used In
Absolute joint angles No Low No ALOHA, ACT, RoboAgent
Absolute Cartesian pose Yes Moderate Yes Classic manipulation research
Cartesian delta actions Yes High Yes (incremental) Diffusion Policy, RT-1, Octo
Object-relative Cartesian Yes Very High Yes Generalizable grasping research
Wegpunkt sequences Yes High Yes Long-horizon task planning

Trajektorierexemplation ist eine der beeinflusstesten Designentscheidungen in einem Roboter-Lernsystem. Verwenden Sie Zeit mit dieser Wahl, bevor Sie in eine groß angelegte Datenerhebung investieren. Siehe die [RCSV-Plattform]T11) für Tools, die alle oben genannten Repräsentationen mit integrierter Formatkonvertierung unterstützen.