Volver a Learn

Representación de trayectoria en el aprendizaje de robots: espacio conjunto, espacio de tareas y deltas

Cómo se almacenan y representan las trayectorias de los robots en algoritmos de aprendizaje <unk> ángulos conjuntos, poses cartesianas, acciones delta y representaciones relativas.

[← Aprender]

La forma en que representa las trayectorias de los robots da forma a lo que su política puede aprender y a qué tan bien generaliza.

¿Qué es la trayectoria de un robot?

Una trayectoria del robot es la secuencia de estados y acciones registradas durante un episodio de operación del robot. Formalmente: T0, donde T1 es la observación completa del sensor en el paso de tiempo T2 (imágenes de la cámara + estados conjuntos + lecturas de fuerza) y T3 es la acción tomada.

Para la formación, la secuencia de acción es lo que la política debe aprender a reproducir. Pero "acción" no es un formato universal único depende de sus opciones de diseño, y esas opciones tienen consecuencias significativas para la generalización de la política y la dificultad de la formación.

Representación Espacial Conjunta

La representación más directa: la acción T4 es un vector de ángulos conjuntos absolutos T5. El controlador robot recibe objetivos de ángulo conjunto y conduce cada conjunto a la posición ordenada.

  • Vantajes: No se requiere IK los ángulos van directamente a los controladores del motor. Determinística: la misma acción produce siempre la misma configuración conjunta.
  • Desventajas: Específico para el brazo. Una política entrenada en un brazo de 6 DOF no puede ser transferida a un brazo de 7 DOF sin reentrenamiento, incluso para la misma tarea.
  • Uso estándar: ALOHA y ACT utilizan el espacio conjunto absoluto como representación de acción principal.

Espacio de tareas cartesianas

La acción T6 representa la pose del efecto final deseada: T7 tres componentes de posición y un cuaternion para la orientación.

  • Vantajes: Intuitivo la acción especifica directamente dónde debe estar el efecto final.
  • Desventajas: Requiere que IK se convierta en comandos conjuntos añade latencia y riesgo de singularidad. La representación de rotación es complicada: los ángulos de Euler tienen bloqueo gimbal (evitarlos), los cuaterniones son compactos pero no únicos (doble cubierta de SO(3)).
  • ** Nota de representación de rotación:** Siempre use cuaterniones (no ángulos de Euler) en el código. Para las salidas de la red neuronal, considere la representación de rotación 6D (las dos primeras columnas de la matriz de rotación) es continua y libre de singularidad.

Acciones del Delta

En lugar de objetivos absolutos, las acciones delta especifican el cambio desde el estado actual: T8 (cambio en ángulos conjuntos) o T9 (cambio en la posición cartesiana).

  • Por qué las deltas son más fáciles de aprender: La magnitud de las acciones delta es pequeña y aproximadamente constante a lo largo de una trayectoria.
  • Seguridad implícita: El recorte de las acciones delta a una magnitud máxima limita la velocidad del robot una importante propiedad de seguridad.
  • Uso estándar: Política de difusión, RT-1, Octo, y la mayoría de los modelos VLA utilizan acciones delta cartesianas como su espacio de acción principal.

Representaciones absolutas frente a objetos

Una pregunta de generalización fundamental: ¿deberían las acciones estar representadas en el marco del espacio de trabajo del robot, o en relación con el objeto que se manipula?

  • Absolute (frame de espacio de trabajo): Los valores de acción dependen de dónde se encuentra el objeto en el espacio de trabajo. Si la tabla se mueve 10 cm, la política falla.
  • Object-relative: Las acciones se expresan como compensaciones de la posición del objeto detectado. La política aprende a "agarrar desde 5 cm por encima del objeto" en lugar de "moverse a (0.3, -0.1, 0.15)". Requiere una detección de objetos o una estimación de posición confiable, pero se generaliza dramáticamente mejor a nuevas alturas de la mesa, posiciones e incluso nuevos entornos.

Duración y acoplamiento de la trayectoria

Las tareas varían en duración: un simple agarre puede tomar 2 segundos (100 pasos a 50Hz); un montaje en múltiples pasos puede tomar 30 segundos (1500 pasos).

  • Duración fija con relleno: Pantalla episodios más cortos a una longitud máxima con un token de acción especial "no-op". Utilice el enmascaramiento de la atención en las políticas basadas en el Transformer para que la red ignore los tokens de relleno.
  • Duración variable con enmascaramiento: Procesar cada episodio a su longitud natural. Requiere un cuidado de lotes (grupar por longitud similar o utilizar relleno dinámico).
  • Cumplimiento de acción: Estilo ACT: rompe la trayectoria en trozos de longitud fija (por ejemplo, 100 pasos) y entrenar los trozos de forma independiente.

Comparación de las representaciones

Representation Intuitive Generalizable IK Needed Used In
Absolute joint angles No Low No ALOHA, ACT, RoboAgent
Absolute Cartesian pose Yes Moderate Yes Classic manipulation research
Cartesian delta actions Yes High Yes (incremental) Diffusion Policy, RT-1, Octo
Object-relative Cartesian Yes Very High Yes Generalizable grasping research
Punto de Paso sequences Yes High Yes Long-horizon task planning

La representación de trayectoria es una de las decisiones de diseño más impactantes en un sistema de aprendizaje robótico. Pasen tiempo en esta opción antes de invertir en la recopilación de datos a gran escala. Véase la [Plataforma RCSV]T11) para obtener herramientas que admiten todas las representaciones anteriores con conversión de formato integrada.