Representación de trayectoria en el aprendizaje de robots: espacio conjunto, espacio de tareas y deltas
Cómo se almacenan y representan las trayectorias de los robots en algoritmos de aprendizaje <unk> ángulos conjuntos, poses cartesianas, acciones delta y representaciones relativas.
[← Aprender]
La forma en que representa las trayectorias de los robots da forma a lo que su política puede aprender y a qué tan bien generaliza.
¿Qué es la trayectoria de un robot?
Una trayectoria del robot es la secuencia de estados y acciones registradas durante un episodio de operación del robot. Formalmente:
Para la formación, la secuencia de acción es lo que la política debe aprender a reproducir. Pero "acción" no es un formato universal único
Representación Espacial Conjunta
La representación más directa: la acción
- Vantajes: No se requiere IK
los ángulos van directamente a los controladores del motor. Determinística: la misma acción produce siempre la misma configuración conjunta. - Desventajas: Específico para el brazo. Una política entrenada en un brazo de 6 DOF no puede ser transferida a un brazo de 7 DOF sin reentrenamiento, incluso para la misma tarea.
- Uso estándar: ALOHA y ACT utilizan el espacio conjunto absoluto como representación de acción principal.
Espacio de tareas cartesianas
La acción
- Vantajes: Intuitivo
la acción especifica directamente dónde debe estar el efecto final. - Desventajas: Requiere que IK se convierta en comandos conjuntos
añade latencia y riesgo de singularidad. La representación de rotación es complicada: los ángulos de Euler tienen bloqueo gimbal (evitarlos), los cuaterniones son compactos pero no únicos (doble cubierta de SO(3)). - ** Nota de representación de rotación:** Siempre use cuaterniones (no ángulos de Euler) en el código. Para las salidas de la red neuronal, considere la representación de rotación 6D (las dos primeras columnas de la matriz de rotación)
es continua y libre de singularidad.
Acciones del Delta
En lugar de objetivos absolutos, las acciones delta especifican el cambio desde el estado actual:
- Por qué las deltas son más fáciles de aprender: La magnitud de las acciones delta es pequeña y aproximadamente constante a lo largo de una trayectoria.
- Seguridad implícita: El recorte de las acciones delta a una magnitud máxima limita la velocidad del robot
una importante propiedad de seguridad. - Uso estándar: Política de difusión, RT-1, Octo, y la mayoría de los modelos VLA utilizan acciones delta cartesianas como su espacio de acción principal.
Representaciones absolutas frente a objetos
Una pregunta de generalización fundamental: ¿deberían las acciones estar representadas en el marco del espacio de trabajo del robot, o en relación con el objeto que se manipula?
- Absolute (frame de espacio de trabajo): Los valores de acción dependen de dónde se encuentra el objeto en el espacio de trabajo. Si la tabla se mueve 10 cm, la política falla.
- Object-relative: Las acciones se expresan como compensaciones de la posición del objeto detectado. La política aprende a "agarrar desde 5 cm por encima del objeto" en lugar de "moverse a (0.3, -0.1, 0.15)". Requiere una detección de objetos o una estimación de posición confiable, pero se generaliza dramáticamente mejor a nuevas alturas de la mesa, posiciones e incluso nuevos entornos.
Duración y acoplamiento de la trayectoria
Las tareas varían en duración: un simple agarre puede tomar 2 segundos (100 pasos a 50Hz); un montaje en múltiples pasos puede tomar 30 segundos (1500 pasos).
- Duración fija con relleno: Pantalla episodios más cortos a una longitud máxima con un token de acción especial "no-op". Utilice el enmascaramiento de la atención en las políticas basadas en el Transformer para que la red ignore los tokens de relleno.
- Duración variable con enmascaramiento: Procesar cada episodio a su longitud natural. Requiere un cuidado de lotes (grupar por longitud similar o utilizar relleno dinámico).
- Cumplimiento de acción: Estilo ACT: rompe la trayectoria en trozos de longitud fija (por ejemplo, 100 pasos) y entrenar los trozos de forma independiente.
Comparación de las representaciones
| Representation | Intuitive | Generalizable | IK Needed | Used In |
|---|---|---|---|---|
| Absolute joint angles | No | Low | No | ALOHA, ACT, RoboAgent |
| Absolute Cartesian pose | Yes | Moderate | Yes | Classic manipulation research |
| Cartesian delta actions | Yes | High | Yes (incremental) | Diffusion Policy, RT-1, Octo |
| Object-relative Cartesian | Yes | Very High | Yes | Generalizable grasping research |
| Punto de Paso sequences | Yes | High | Yes | Long-horizon task planning |
La representación de trayectoria es una de las decisiones de diseño más impactantes en un sistema de aprendizaje robótico. Pasen tiempo en esta opción antes de invertir en la recopilación de datos a gran escala. Véase la [Plataforma RCSV]







