Análisis de la modalidad de fallo de la política de robots: por qué los robots entrenados no logran su implementación
Análisis sistemático de cómo las políticas de robots entrenados fallan <unk> cambio de distribución, cambio de covariado, colapso de modo y estrategias de recuperación.
[← Investigación]
Una taxonomía de los modos de fracaso de la política de robots, con estrategias de mitigación para cada lectura esencial antes de implementar una política entrenada en un entorno real.
Por qué es importante analizar el modo de falla
Una política que logra un éxito del 82% en la evaluación de laboratorio puede fallar en el despliegue en 40
Los modos de falla a continuación están organizados por causa y incluyen tanto señales de diagnóstico (cómo identificar si este modo está causando fallos) como estrategias de mitigación (cómo arreglarlo con datos, cambios de arquitectura o modificaciones de implementación).
Modo de falla 1: Entrada visual fuera de distribución
Sintomas: La política funciona bien en el entorno de laboratorio, pero falla inmediatamente cuando se implementa en un nuevo lugar, bajo una iluminación diferente o con un aspecto de objeto ligeramente diferente (variante de color nuevo, etiqueta desgastada, acabado de superficie diferente).
- ** Causa raíz:** Los datos de formación se recopilan en un conjunto estrecho de condiciones visuales.
- ** Prueba de diagnóstico:** Recoger 20 episodios de prueba en 3 condiciones de iluminación diferentes (luz fluorescente frente a luz natural frente a luz tenue), 2 alturas de mesa (±10 cm), y con 3 objetos distractivos colocados en el espacio de trabajo.
- Mitigación
aumento de datos: Aumento de imágenes de entrenamiento con un desgaste de color aleatorio (brillo ±30%, contraste ±30%, tonalidad ±20%), sustitución de fondo aleatorio (pase de espacio de trabajo en fondos aleatorios de ImageNet) y simulación de iluminación aleatoria. Aplicar el aumento en el tiempo de entrenamiento a partir de imágenes crudas, no horneadas. - Mitigación
recopilación de datos diversa: Recoger demostraciones en múltiples condiciones de iluminación, superficies de tablas y configuraciones de fondo durante la fase inicial de recopilación de datos. 5x el costo frente a la recopilación en una sola condición, pero políticas dramáticamente más robustas. - Mitigación
adaptación de dominio: Después de la implementación, recoger 50100 episodios de demostración en el entorno de implementación y ajustar la política.
Modo de falla 2: errores de composición (cambio de covariado BC)
Sintomas: La política comienza la tarea correctamente pero gradualmente se desvía a estados inusuales que no ha visto en la formación, luego falla catastróficamente. El fracaso ocurre cada vez más temprano en la tarea a medida que las condiciones se vuelven menos familiares.
- ** Causa raíz:** La clonación de comportamiento (y sus variantes) se desarrolla sólo en estados de distribución (estados que aparecieron en las trayectorias de capacitación). Cualquier pequeño error de política desplaza al robot a un estado no en la distribución de capacitación, causando errores más grandes, lo que lleva a estados aún más lejos de la capacitación y, finalmente, a un fracaso catastrófico.
- ** Prueba de diagnóstico:** Traza la distribución de los estados en los que ocurren fallas a lo largo de la línea de tiempo de la tarea.
- Mitigación
acción de fragmentación (ACT): Previr H pasos futuros obliga a la política a planificar trayectorias coherentes en lugar de reaccionar paso a paso. - Mitigación
DAgger: Aggregación de Datos. Después de un conjunto de capacitación inicial, despliegue la política y tenga una etiqueta de experto humano correcciones cuando la política cometa errores. Agrega éstas al conjunto de capacitación y retrén. - Mitigación
política de difusión: La denotación iterativa de secuencias de acción de difusión es más robusta para errores de ejecución tempranas que la predicción de un solo paso porque el proceso de denotación se centra implícitamente en trayectorias plausibles.
Modo de falla 3: Collapso de modo y mediado de modo
Sintomas: Existen múltiples estrategias válidas en los datos de formación (por ejemplo, agarrar desde la izquierda o la derecha), pero la política ejecuta una trayectoria intermedio confusa que no es estrategia y falla en ambas.
- ** Causa raíz:** El entrenamiento estándar de medio-cuadrado-error de una política determinista minimiza el error promedio de predicción en todas las demostraciones. Cuando existen múltiples modos, la predicción mínima de error promedio es la media de todos los modos
que no es una trayectoria válida. - ** Prueba de diagnóstico:** Revisar todas las demostraciones de formación y identificar manualmente si hay múltiples estrategias distintas. Si los operadores utilizan enfoques cualitativamente diferentes (ángulo de aproximación diferente, tipo de captura diferente), es probable que se produzca una media de modo.
- Mitigación
CVAE (ACT): El VAE condicional de ACT codifica el "estilo" de la demostración en una variable latente, lo que permite a la política comprometerse con un modo en el momento de la inferencia. - Mitigación
política de difusión: La difusión maneja naturalmente las distribuciones multimodal aprendiendo a denotar desde cualquiera de los modos, no mediandolos. - Mitigación
curado de datos: Si una estrategia es preferida (por ejemplo, siempre se enfoca desde la izquierda en el entorno de despliegue), curar el conjunto de capacitación para representar esa estrategia en exceso. Una combinación de 70/30 en lugar de 50/50 incide en la política hacia el modo preferido.
Modo de falla 4: degradación de precisión cerca del contacto
Sintomas: La política funciona bien durante el acercamiento y el posicionamiento grueso, pero falla constantemente en el momento del contacto
- ** Causa raíz:** La percepción basada en la cámara tiene una resolución finita. A una distancia típica de 60
80 cm de la cámara fija del espacio de trabajo, 1 píxel de la cámara corresponde a aproximadamente 0,5 1 mm de posición del espacio de trabajo. Para tareas que requieren precisión de <3 mm, el ruido de píxel es comparable a la precisión requerida. - Mitigación
cámara de muñeca: Una cámara montada en la muñeca (515 cm desde el punto de contacto) proporciona una resolución efectiva 10 20× mayor en la fase de precisión crítica. - Mitigación
retroalimentación de fuerza/torque: La adición de un sensor F/T montado en la muñeca (ATI Mini45, OnRobot HEX) proporciona detección de contacto que no depende de la resolución de la cámara. - Mitigación
política de dos fases: Dividir la tarea en una fase de posicionamiento grueso (basada en la cámara, resolución estándar) y una fase de contacto de precisión (cámara de muñeca o retroalimentación F/T).
Modo de falla 5: Manejo de la oclusión
Sintomas: La política funciona bien cuando el espacio de trabajo está desoculto, pero falla cuando el brazo robot o el agarre se encuentra entre la cámara y el objeto de interés.
- ** Causa raíz:** Las cámaras fijas no pueden ver a través del brazo robótico. Cuando el robot se acerca a un objeto, el brazo oculta la vista de la cámara fija. Si los datos de entrenamiento no se recopilan en estas mismas condiciones de oclusión, la política recibe imágenes fuera de distribución precisamente cuando más necesita retroalimentación visual precisa.
- Mitigación
cámara de muñeca: Una cámara montada en la muñeca mantiene una visión consistente de la interfaz del sujetador-objeto independientemente de la configuración del brazo. - Mitigación
Configuración de múltiples vistas: Agregar una segunda cámara fija en un ángulo diferente (por ejemplo, sobrecarga + lado) asegura que al menos una cámara siempre tenga una visión clara del espacio de trabajo, incluso durante la oclusión del brazo. - Mitigación
condiciones de recogida consistentes: Si la oclusión es inevitable en el despliegue, asegúrese de que los datos de formación se recopilen con el brazo en las mismas configuraciones de oclusión.
Protocolo de evaluación del modo de falla
Antes de implementar una política, ejecute este protocolo de evaluación sistemática:
- ** Condiciones nominales:** 30 ensayos en condiciones de laboratorio de formación.
- Variación de iluminación: 10 ensayos cada uno en 3 condiciones de iluminación distintas (fluorescente por encima, ambiente cálido, tenue).
- Altaza y posición: 10 ensayos a 2 tablas de altura (±10 cm de altura de entrenamiento).
- Objetos distractivos: 10 ensayos con 3
5 objetos irrelevantes en el espacio de trabajo. - ** Novelas variantes de objetos:** 10 ensayos con una variante diferente de color o textura del objeto objetivo.
- Medio de despliegue: 20 ensayos en el entorno de despliegue real antes del lanzamiento.
Evaluación sistemática de las políticas
La plataforma RCSV incluye un marco de evaluación estructurado que ejecuta su política contra el protocolo de modo de falla automáticamente en simulación y señala los riesgos antes de su implementación en el mundo real.







