Trajektorierepräsentation im Roboternutzen: Gemeinsame Raum, Aufgabenraum und Deltas
Wie Roboterbahnen in Lernalgorithmen gespeichert und dargestellt werden <unk> gemeinsame Winkel, kartesische Posen, Delta-Aktionen und relative Darstellungen.
[← Lernen]
Die Art und Weise, wie Sie Roboterbahnen darstellen, prägt, was Ihre Politik lernen kann und wie gut sie sich verallgemeint.
Was ist eine Roboterbahn?
Eine Roboterbahn ist die Reihenfolge von Zuständen und Aktionen, die während einer Episode des Roboterbetriebs aufgezeichnet wurden. Formal:
Die Maßnahmen, die die Politik ergreifen muss, sind für die Ausbildung die Handlungsfolge. "Aktion" ist jedoch kein einheitliches universelles Format
Gemeinsame Raumfahrtvertretung
Die direkteste Darstellung: Die Aktion
- Vorteile: Keine IK erforderlich
Winkel gehen direkt zu den Motorcontrollern. Deterministisch: dieselbe Aktion erzeugt immer die gleiche gemeinsame Konfiguration. - ** Nachteile:** Arm-spezifisch. Eine auf einem 6-DOF-Arm ausgebildete Politik kann nicht ohne Umschulung auf einen 7-DOF-Arm übertragen werden, auch für die gleiche Aufgabe.
- Standardverwendung: ALOHA und ACT verwenden als primäre Aktionsdarstellung einen absoluten gemeinsamen Raum.
Cartesianische Aufgabenfläche
Die Aktion
- Vorteile: Intuitiv
Die Aktion spezifiziert direkt, wo sich der Endefektor befinden sollte. - ** Nachteile:** IK ist erforderlich, um auf gemeinsame Befehle umzugehen
ergibt ein Lattenz- und Singularitätsrisiko. Die Rotationsdarstellung ist schwierig: Eulerwinkel haben eine Gimmelsperre (meiden sie), Quaternions sind kompakt, aber nicht einzigartig (Doppeldeckung von SO(3)). - Rotationsrepräsentation Note: Verwenden Sie in Code immer Quaternions (nicht Eulerwinkel). Für die Ausgänge von neuronalen Netzwerken betrachten Sie die 6D-Rotationsrepräsentation (die ersten beiden Spalten der Rotationsmatrix)
es ist kontinuierlich und singularitätfrei.
Delta-Aktionen
Anstelle absoluter Ziele geben die Delta-Aktionen den change aus dem aktuellen Zustand an:
- ** Warum Delta-Aktionen leichter zu erlernen sind:** Die Größe der Delta-Aktionen ist klein und ungefähr konstant über eine Trajektorie hinweg.
- ** Implizite Sicherheit:** Das Einschneiden von Delta-Aktionen auf eine maximale Größe begrenzt die Geschwindigkeit des Roboters
eine wichtige Sicherheitsmerkmal. - Standardverwendung: Diffusion Policy, RT-1, Octo und die meisten VLA-Modelle verwenden als primärer Aktionsraum kartesische Delta-Aktionen.
Absolute gegen objektrelevante Repräsentationen
Eine grundlegende Frage der Allgemeinheit: Sollten Aktionen im Arbeitsraum des Roboters dargestellt werden oder bezogen auf das Manipulationsobjekt?
- Absolute (Arbeitsraum-Framme): Aktionswerte hängen von der Position des Objekts im Arbeitsraum ab. Wenn die Tabelle 10 cm verschoben wird, wird die Politik gescheitert. Gutes für feste Einstellungen; schlecht für die Generalisierung.
- Objekt-relative: Aktionen werden als Offset von der detektierten Objektposition ausgedrückt. Politik lernt "ab 5 cm über dem Objekt" statt "zu bewegen zu (0,3, -0,1, 0.15)". Erfordert eine zuverlässige Objektdetektion oder Posenbewertung, aber verallgemeinert sich dramatisch besser auf neue Tabellehöhen, Positionen und sogar neue Umgebungen.
Streckenlänge und Padding
Die Dauer der Aufgaben variiert: Ein einfaches Gehen kann 2 Sekunden dauern (100 Schritte bei 50Hz); eine mehrschrittliche Montage kann 30 Sekunden dauern (1500 Schritte).
- Fixed-Length mit Polsterung: Pad kürzere Episoden auf maximale Länge mit einem speziellen "no-op" Aktions-Token. Verwenden Sie Aufmerksamkeitsmasken in Transformer-basierten Richtlinien, damit das Netzwerk Polsterung Token ignoriert. Einfach umzusetzen.
- Variable-Länge mit Maskierung: Prozess jede Episode nach ihrer natürlichen Länge.
- Action Chunking: ACT-Stil: Brechen Sie die Bahn in Stück mit fester Länge (z.B. 100 Schritte) und trainieren Sie sich selbständig auf Stück.
Vergleiche der Repräsentationen
| Representation | Intuitive | Generalizable | IK Needed | Used In |
|---|---|---|---|---|
| Absolute joint angles | No | Low | No | ALOHA, ACT, RoboAgent |
| Absolute Cartesian pose | Yes | Moderate | Yes | Classic manipulation research |
| Cartesian delta actions | Yes | High | Yes (incremental) | Diffusion Policy, RT-1, Octo |
| Object-relative Cartesian | Yes | Very High | Yes | Generalizable grasping research |
| Wegpunkt sequences | Yes | High | Yes | Long-horizon task planning |
Trajektorierexemplation ist eine der beeinflusstesten Designentscheidungen in einem Roboter-Lernsystem. Verwenden Sie Zeit mit dieser Wahl, bevor Sie in eine groß angelegte Datenerhebung investieren. Siehe die [RCSV-Plattform]







