Volver a Research

El tiempo del robot: por qué la alineación temporal es el cuello de botella oculto en el aprendizaje del robot

La desalinamiento temporal entre cámaras, estados conjuntos y comandos del motor corrompe las demostraciones de robots como ruido de etiqueta estructurado.

[← Investigación]

La comunidad de aprendizaje robótico está ampliando las demostraciones. Pero la mayoría de esos datos están temporalmente contaminados y el campo lo está tratando como un problema de cantidad de datos cuando en realidad es un problema de calidad de datos.

13 marcos

de desalineamiento temporal = 23x más demostraciones necesarias

El problema: la falta de alineamiento temporal como ruido estructurado de etiquetas

En la clonación de comportamiento, se supone que cada muestra de entrenamiento es un par (ot, at) la observación en el tiempo t emparejada con la acción en el tiempo t. En la práctica, lo que la mayoría de los sistemas de recogida realmente registran es (ot−δo, at+δa), donde δo y δa son desconocidos, retrasos variables introducidos por la tubería de la cámara, programación del sistema operativo, latencia del bus y cronometrado del bucle de control.

Este no es ruido aleatorio. Es ruido de etiqueta estructurado que se correlaciona con el estado físico del sistema. La magnitud de la desalinuación temporal crece con la velocidad del efecto final, cambia en las transiciones de contacto, varía con la frecuencia de control y depende del tiempo de exposición de la cámara. Durante los momentos exactos que más importan para el aprendizaje de políticas movimientos rápidos, eventos de contacto, alineamientos de precisión el error temporal está en su peor momento.

La aritmética es sencilla. A 30 fps, un marco de compensación es de 33 ms. Un brazo robótico que se mueve a 0,5 m/s desplaza 16.5 mm por marco. Para tareas de manipulación de precisión inserción de peg-in-hole, enrutamiento de cable, apareamiento de conectores 16.5 mm de ambigüedad posicional es catastrófico. La política aprende una versión borrosa de la tarea, promediando en pares de observación-acción temporalmente desalineados. Luego se necesitan 23x más demostraciones para converger a la misma tasa de éxito que los datos adecuadamente alineados producirían con menos episodios.

Los sistemas ampliamente utilizados en la comunidad de investigación incluyendo ALOHA, UMI y configuraciones de cámaras USB estándar exhiben 2080 ms de nerviosismo de tiempo no medido entre los marcos de la cámara y las readbacks de estado conjunto.

Por qué las temporizadoras de software no lo arreglan

La respuesta instintiva es marcar el tiempo de todo. La mayoría de las bases de código de recogida llaman T0 o T1 en cada lectura del sensor y asumen que el problema se ha resuelto.

Las timestamps del lado del anfitrión miden cuando el sistema operativo recibió los datos, no cuando ocurrió el evento físico. Entre el fotón que golpea el sensor y la timestamp que se registra, se acumulan múltiples fuentes de retraso variable:

  • Latencia de encuestas USB: USB 2.0 encuestas a intervalos de 1 ms; USB 3.0 a 125 μs. Pero la transferencia real es programada por el controlador de alojamiento y puede retrasarse por la disputa de bus.
  • ** Programación de OS:** El núcleo programa el manipulador de interrupción USB, luego el callback del espacio de usuario. En un núcleo Linux no RT bajo carga, el jitter de programación oscila entre 150 ms. Un proceso de Python agrega contención GIL en la parte superior.
  • Obturador de rodamiento de la cámara: Un sensor de rodamiento expone las filas superior e inferior en diferentes momentos, típicamente de 15 33 ms. La "estampa de tiempo" del marco es ambigua la imagen es un mancha temporal, no un instantáneo.
  • Buffering de red: Si los sensores se comunican a través de Ethernet (RealSense a través de USB, temas ROS a través de DDS, unidades de motor EtherCAT), el buffering de la pila de red añade otra capa de retraso variable.
  • Latencia de bus de estado conjunto: El bus CAN, el UART serial y EtherCAT tienen cada uno sus propias latencias de lectura. El bus CAN a 1 Mbps con 8 juntas introduce ~ 1 ms de retraso de serialización; el UART serial a 115200 baud es peor. Los estados conjuntos se leen secuencialmente, por lo que el conjunto 1 y el conjunto 6 ni siquiera son simultáneos.

Estos retrasos son individualmente pequeños pero colectivamente variables. Peor aún, no son constantes cambian con la carga del sistema, la topología USB, el tráfico de la red e incluso la temperatura ambiente (afetando la deriva del oscilador de cristal).

Las cuatro capas de la alineación temporal del robot

Para fijar la alineación temporal se deben abordar cuatro capas distintas, cada una construida sobre la que está debajo de ella.

4 de la Comisión

Certificación de conjunto de datos

Cada conjunto de datos se envía con un informe temporal de salud para que los consumidores de abajo sepan en qué están entrenando.

3 El

Enlace de sensores y actuadores

Cada modalidad de una muestra de entrenamiento está ligada al mismo instante físico, no solo al mismo sello de tiempo del software.

2 de la Comisión

Desarrollo de hardware

cámaras de obturación global con líneas de disparos externas, exposición sincronizada en todos los puntos de vista, sin manchas de obturación, sin relojes de marco de libre funcionamiento que se alejen.

1 de la Comisión

Sincronización del reloj

PTP (IEEE 1588) o fuentes compartidas de reloj en todos los dispositivos. Cada sensor, actuador y nodo de cálculo acuerda qué hora es en microsecondas, no milisegundos.

La mayoría de las configuraciones de aprendizaje robótico no implementan ninguna de estas capas. Algunas implementan la capa 1 parcialmente (NTP, no PTP). Casi ninguna implementa las capas 24. El resultado es que la alineación temporal de los datos de entrenamiento es desconocida y los investigadores optimizan arquitecturas e hiperparámetros en datos cuya calidad fundamental no se mide.

El enfoque del RCSV: Infraestructura temporal basada en hardware

La infraestructura de recopilación de datos del RCSV implementa las cuatro capas de alineación temporal como defecto, no como un complemento.

  • <5 ms sincronización en todos los flujos. Las cámaras de obturación global activadas por hardware disparan en la misma línea de disparos que las readbacks conjuntas de estado. La exposición de la cámara, el bloqueo de codificador conjunto y el sello de tiempo de comando motor están vinculados a un borde compartido del reloj, no a los bucles de encuestas independientes de software.
  • LED + decodificación de fase PRBS para la medición de retraso de captura real. Una matriz LED impulsada por una secuencia binaria pseudo aleatoria (PRBS) es visible en el campo de visión de la cámara. Al decodificar el patrón PRBS en la imagen capturada, medimos el retraso real de extremo a extremo desde el gatillo hasta la captura de píxeles incluyendo cualquier latencia de tubería que el firmware de la cámara introduzca. Este no es un paso de calibración; se ejecuta continuamente.
  • Métricas de tiempo de salud en cada conjunto de datos. Cada conjunto de datos suministrado por RCSV incluye un informe de tiempo por episodio: jitter máximo, compensación de sincronización media, recuento de cuadros caídos y un histograma completo de jitter.
  • Resultado: 23 veces menos demostraciones necesarias.* En las tareas iguales (pick-place, inserción de peg, enrutamiento de cables), las políticas entrenadas en datos RCSV sincronizados con hardware alcanzan tasas de éxito equivalentes con 23 veces menos demostraciones en comparación con la misma tarea recogida con las configuraciones de cámaras USB con sello de tiempo de software. Las demostraciones no son mejores porque los operadores son mejores son mejores porque cada par de observación-acción en realidad corresponde al mismo instante físico.

Trabajo relacionado

La calibración temporal tiene una larga historia en sistemas multi-sensores, aunque ha recibido sorprendentemente poca atención en la comunidad de recopilación de datos de aprendizaje robótico específicamente:

  • **Furgale et al., "Unified Temporal and Spatial Calibración for Multi-Sensor Systems" (IROS 2013) ** El marco Kalibr introdujo la calibración temporal y espacial conjunta para los sistemas de cámara-IMU.
  • **Qin & Shen, "Calibración temporal en línea para sistemas visuales inertes monoculares" (2018) ** Demostró que las compensaciones de tiempo de la cámara-IMU se pueden estimar en línea durante la operación de VIO, eliminando la necesidad de calibración fuera de línea.
  • **Tschopp et al., "VersaVIS: Un conjunto de sensores visuales e inertes visuales multi-camera versátiles abiertos" (2019) ** Sistema multi-camera + IMU activado por hardware con sincronización de submillisecondas. El precursor más cercano a lo que necesita la recopilación de datos de aprendizaje de robots, diseñado para SLAM en lugar de manipulación.
  • **Zhao et al., "Aprender Manipulación Bimanual de Granado Fina con Hardware de Bajo Costo" (2023) ** El sistema ALOHA utiliza sellos de tiempo de software en cámaras USB y autobuses de serie Dynamixel.
  • **Khazatsky et al., "DROID: Un Dataset de Manipulación de Robots en la Naturaleza a Gran escala" (2024) ** 76K episodios en 564 escenas. Utiliza cámaras RealSense con sellos de tiempo del lado del anfitrión.
  • **Chi et al., "Interfaz de manipulación universal" (2024) ** UMI utiliza cámaras GoPro con estimación de la posición basada en SLAM y etiquetas de acción interpoladas.
  • **F2F-AP: "Política asincrona de flujo hacia el futuro" (2026) Propone una compensación aprendida por flujos asincronos de observación y acción. Demuestra que incluso los enfoques algorítmicos se benefician del conocimiento del tiempo de la verdad fundamental y de la distribución de los datos de formación.

Lo que sigue: SyncBench

El RCSV está desarrollando SyncBench: un indicador de referencia que mide directamente cómo las condiciones de alineación temporal afectan el rendimiento de las políticas.

  • La misma tarea, la misma arquitectura de políticas, un tiempo diferente. Tres condiciones: (1) solo marcas de tiempo de software, (2) cámaras activadas por hardware sin sin sincronización completa, (3) alineación temporal completa de cuatro capas como se describe anteriormente.
  • Espectro de tareas. Desde temporalmente tolerante (picking de contenedores, apilamiento de bloques) hasta temporalmente exigente (inserción de peg a tolerancia de 0,5 mm, cableado de hilo, apareamiento de conectores USB).
  • Metricas. Por condición: distribución de los nervios (p50/p95/p99), tasa de éxito de las políticas en 50/100/200/500 demostraciones, demostraciones mínimas para alcanzar el 80% de éxito y descomposición del modo de falla (superpaseo, falta de contacto, deslizamiento de agarre, colisión).

Sin embargo, el análisis de la información de SyncBench muestra que la alineación temporal es un predictor más fuerte de la eficiencia de la muestra que la elección de la arquitectura para las tareas ricas en contactos.

Recopilación de datos sincronizada con hardware

El RCSV proporciona datos de demostración alineados temporalmente con certificación de tiempo por muestra.

[Habla con nuestro equipo] [T3] [Aprende sobre los servicios de datos] [T4]