Volver a Research

Análisis de la modalidad de fallo de la política de robots: por qué los robots entrenados no logran su implementación

Análisis sistemático de cómo las políticas de robots entrenados fallan <unk> cambio de distribución, cambio de covariado, colapso de modo y estrategias de recuperación.

[← Investigación]

Una taxonomía de los modos de fracaso de la política de robots, con estrategias de mitigación para cada lectura esencial antes de implementar una política entrenada en un entorno real.

Por qué es importante analizar el modo de falla

Una política que logra un éxito del 82% en la evaluación de laboratorio puede fallar en el despliegue en 4050%. La brecha no es aleatoria casi siempre es causada por modos de falla específicos y identificables que podrían haber sido diagnosticados y mitigados antes del despliegue.

Los modos de falla a continuación están organizados por causa y incluyen tanto señales de diagnóstico (cómo identificar si este modo está causando fallos) como estrategias de mitigación (cómo arreglarlo con datos, cambios de arquitectura o modificaciones de implementación).

Modo de falla 1: Entrada visual fuera de distribución

Sintomas: La política funciona bien en el entorno de laboratorio, pero falla inmediatamente cuando se implementa en un nuevo lugar, bajo una iluminación diferente o con un aspecto de objeto ligeramente diferente (variante de color nuevo, etiqueta desgastada, acabado de superficie diferente).

  • ** Causa raíz:** Los datos de formación se recopilan en un conjunto estrecho de condiciones visuales.
  • ** Prueba de diagnóstico:** Recoger 20 episodios de prueba en 3 condiciones de iluminación diferentes (luz fluorescente frente a luz natural frente a luz tenue), 2 alturas de mesa (±10 cm), y con 3 objetos distractivos colocados en el espacio de trabajo.
  • Mitigación aumento de datos: Aumento de imágenes de entrenamiento con un desgaste de color aleatorio (brillo ±30%, contraste ±30%, tonalidad ±20%), sustitución de fondo aleatorio (pase de espacio de trabajo en fondos aleatorios de ImageNet) y simulación de iluminación aleatoria. Aplicar el aumento en el tiempo de entrenamiento a partir de imágenes crudas, no horneadas.
  • Mitigación recopilación de datos diversa: Recoger demostraciones en múltiples condiciones de iluminación, superficies de tablas y configuraciones de fondo durante la fase inicial de recopilación de datos. 5x el costo frente a la recopilación en una sola condición, pero políticas dramáticamente más robustas.
  • Mitigación adaptación de dominio: Después de la implementación, recoger 50100 episodios de demostración en el entorno de implementación y ajustar la política.

Modo de falla 2: errores de composición (cambio de covariado BC)

Sintomas: La política comienza la tarea correctamente pero gradualmente se desvía a estados inusuales que no ha visto en la formación, luego falla catastróficamente. El fracaso ocurre cada vez más temprano en la tarea a medida que las condiciones se vuelven menos familiares.

  • ** Causa raíz:** La clonación de comportamiento (y sus variantes) se desarrolla sólo en estados de distribución (estados que aparecieron en las trayectorias de capacitación). Cualquier pequeño error de política desplaza al robot a un estado no en la distribución de capacitación, causando errores más grandes, lo que lleva a estados aún más lejos de la capacitación y, finalmente, a un fracaso catastrófico.
  • ** Prueba de diagnóstico:** Traza la distribución de los estados en los que ocurren fallas a lo largo de la línea de tiempo de la tarea.
  • Mitigación acción de fragmentación (ACT): Previr H pasos futuros obliga a la política a planificar trayectorias coherentes en lugar de reaccionar paso a paso.
  • Mitigación DAgger: Aggregación de Datos. Después de un conjunto de capacitación inicial, despliegue la política y tenga una etiqueta de experto humano correcciones cuando la política cometa errores. Agrega éstas al conjunto de capacitación y retrén.
  • Mitigación política de difusión: La denotación iterativa de secuencias de acción de difusión es más robusta para errores de ejecución tempranas que la predicción de un solo paso porque el proceso de denotación se centra implícitamente en trayectorias plausibles.

Modo de falla 3: Collapso de modo y mediado de modo

Sintomas: Existen múltiples estrategias válidas en los datos de formación (por ejemplo, agarrar desde la izquierda o la derecha), pero la política ejecuta una trayectoria intermedio confusa que no es estrategia y falla en ambas.

  • ** Causa raíz:** El entrenamiento estándar de medio-cuadrado-error de una política determinista minimiza el error promedio de predicción en todas las demostraciones. Cuando existen múltiples modos, la predicción mínima de error promedio es la media de todos los modos que no es una trayectoria válida.
  • ** Prueba de diagnóstico:** Revisar todas las demostraciones de formación y identificar manualmente si hay múltiples estrategias distintas. Si los operadores utilizan enfoques cualitativamente diferentes (ángulo de aproximación diferente, tipo de captura diferente), es probable que se produzca una media de modo.
  • Mitigación CVAE (ACT): El VAE condicional de ACT codifica el "estilo" de la demostración en una variable latente, lo que permite a la política comprometerse con un modo en el momento de la inferencia.
  • Mitigación política de difusión: La difusión maneja naturalmente las distribuciones multimodal aprendiendo a denotar desde cualquiera de los modos, no mediandolos.
  • Mitigación curado de datos: Si una estrategia es preferida (por ejemplo, siempre se enfoca desde la izquierda en el entorno de despliegue), curar el conjunto de capacitación para representar esa estrategia en exceso. Una combinación de 70/30 en lugar de 50/50 incide en la política hacia el modo preferido.

Modo de falla 4: degradación de precisión cerca del contacto

Sintomas: La política funciona bien durante el acercamiento y el posicionamiento grueso, pero falla constantemente en el momento del contacto se pierde en 25 mm en las tareas de inserción, se deja caer objetos durante la transferencia o no se puede colocar en los conectores de asiento.

  • ** Causa raíz:** La percepción basada en la cámara tiene una resolución finita. A una distancia típica de 6080 cm de la cámara fija del espacio de trabajo, 1 píxel de la cámara corresponde a aproximadamente 0,51 mm de posición del espacio de trabajo. Para tareas que requieren precisión de <3 mm, el ruido de píxel es comparable a la precisión requerida.
  • Mitigación cámara de muñeca: Una cámara montada en la muñeca (515 cm desde el punto de contacto) proporciona una resolución efectiva 1020× mayor en la fase de precisión crítica.
  • Mitigación retroalimentación de fuerza/torque: La adición de un sensor F/T montado en la muñeca (ATI Mini45, OnRobot HEX) proporciona detección de contacto que no depende de la resolución de la cámara.
  • Mitigación política de dos fases: Dividir la tarea en una fase de posicionamiento grueso (basada en la cámara, resolución estándar) y una fase de contacto de precisión (cámara de muñeca o retroalimentación F/T).

Modo de falla 5: Manejo de la oclusión

Sintomas: La política funciona bien cuando el espacio de trabajo está desoculto, pero falla cuando el brazo robot o el agarre se encuentra entre la cámara y el objeto de interés.

  • ** Causa raíz:** Las cámaras fijas no pueden ver a través del brazo robótico. Cuando el robot se acerca a un objeto, el brazo oculta la vista de la cámara fija. Si los datos de entrenamiento no se recopilan en estas mismas condiciones de oclusión, la política recibe imágenes fuera de distribución precisamente cuando más necesita retroalimentación visual precisa.
  • Mitigación cámara de muñeca: Una cámara montada en la muñeca mantiene una visión consistente de la interfaz del sujetador-objeto independientemente de la configuración del brazo.
  • Mitigación Configuración de múltiples vistas: Agregar una segunda cámara fija en un ángulo diferente (por ejemplo, sobrecarga + lado) asegura que al menos una cámara siempre tenga una visión clara del espacio de trabajo, incluso durante la oclusión del brazo.
  • Mitigación condiciones de recogida consistentes: Si la oclusión es inevitable en el despliegue, asegúrese de que los datos de formación se recopilen con el brazo en las mismas configuraciones de oclusión.

Protocolo de evaluación del modo de falla

Antes de implementar una política, ejecute este protocolo de evaluación sistemática:

  • ** Condiciones nominales:** 30 ensayos en condiciones de laboratorio de formación.
  • Variación de iluminación: 10 ensayos cada uno en 3 condiciones de iluminación distintas (fluorescente por encima, ambiente cálido, tenue).
  • Altaza y posición: 10 ensayos a 2 tablas de altura (±10 cm de altura de entrenamiento).
  • Objetos distractivos: 10 ensayos con 35 objetos irrelevantes en el espacio de trabajo.
  • ** Novelas variantes de objetos:** 10 ensayos con una variante diferente de color o textura del objeto objetivo.
  • Medio de despliegue: 20 ensayos en el entorno de despliegue real antes del lanzamiento.

Evaluación sistemática de las políticas

La plataforma RCSV incluye un marco de evaluación estructurado que ejecuta su política contra el protocolo de modo de falla automáticamente en simulación y señala los riesgos antes de su implementación en el mundo real.

Explora la plataforma →