Volver a Blog

10 errores comunes en el aprendizaje por robots (y cómo corregirlos)

Los errores más comunes que cometen los equipos al entrenar las políticas de robots con aprendizaje de imitación <unk> calidad de datos, elección de algoritmos, evaluación y errores de implementación con correcciones específicas para cada uno.

Parte de: [Guía de aprendizaje por imitación]

[← Blog] T2)

La mayoría de los fallos de aprendizaje por imitación se remontan a problemas de datos, no a problemas de algoritmo. Aquí están los 10 errores que vemos con mayor frecuencia, con correcciones técnicas específicas para cada uno.

Introducción

El aprendizaje de imitación es engañosamente accesible. El algoritmo es simple, la configuración es estándar, y hay excelentes implementaciones de código abierto para [ACT] T3), Política de difusión y LeRobot. Sin embargo, la mayoría de los equipos se encuentran con el mismo conjunto de errores evitables - errores que pueden perder semanas de tiempo de ingeniería y producir políticas que fallan en la implementación. Este artículo catalogará diez de los más comunes, con métodos de detección concretos y correcciones para cada uno.

Erro 1: Demasiados pocos demos para dificultad

El error más común es aplicar un recuento de demostración fijo independientemente de la complejidad de la tarea. Los equipos leen que ACT logró resultados sólidos con 50 demostraciones en una simple tarea de selección y asumen que 200 serán suficientes para su tarea de ensamblaje de precisión.

Escala de dificultad aproximada: L1 (alcanzamiento y agarre de grandes objetos en bucle abierto): 50-200 demos. L2 (emplazamiento de bucle cerrado con diversas poses de objetos): 300-800 demos. L3 (inserción rica en contacto, ensamblaje con tolerancia de 5 mm): 1.000-5.000 demos. L4 (manipulación dexterosa en la mano): 5.000-20.000 demos.

Cómo detectar: Las pérdidas de formación convergen pero la tasa de éxito de la evaluación es baja (<60%).

Fix: Utilice la escala de dificultad anterior como una estimación presupuestaria antes de comenzar a recogerla. Si el costo estimado excede su presupuesto, considere si la tarea puede simplificarse (una mayor tolerancia, un objeto pre-posicionado) para bajar un nivel de dificultad.

Erro 2: Iluminación inconsistente entre la recogida y la distribución

Los cambios de iluminación que parecen triviales para el ojo humano -- moverse de la mañana al sol por la tarde a través de una ventana, reemplazar un tubo fluorescente por encima, abrir una puerta cercana -- pueden cambiar los valores de píxeles en un 15-30% y causar que las políticas visuales fallen catastróficamente. Hemos visto políticas con una tasa de éxito del 90% en la sala de recopilación de datos lograr un éxito del 20% cuando se despliega un piso en un edificio diferente.

Cómo detectar: La política funciona bien en el entorno de recogida pero falla en la implementación. Visualice la alimentación de la cámara desde ambos entornos - diferencias de histograma >15% en cualquier canal indican un problema de iluminación.

Fix: Control de la iluminación durante la recopilación de datos (cortinas de apagón o paneles LED con temperatura de color fija, 5000K de luz del día equilibrada). Aplique un aumento agresivo de la nerviosidad de color durante el entrenamiento: brillo +/-30%, tono +/-20%, saturación +/-15%.

Erro 3: No filtrar las demostraciones fallidas

Los datos de demostración crudos de los nuevos operadores suelen contener entre 15 y 30% de episodios fallidos. Los operadores que están aprendiendo el sistema de teleoperación hacen agarradas, liberan accidentalmente objetos o abortan a mitad de tarea. Si los incluye en su conjunto de entrenamiento, la política aprende a imitar comportamientos exitosos y fracasados, lo que es un promedio de una política mediocre.

Cómo detectar: Si la política muestra vacilación, captura parcial o comportamiento "confundido" que parece estar en promedio entre dos estrategias diferentes, revise su conjunto de entrenamientos: si >5% de los episodios no logran claramente, tiene este problema.

Fix: Construir o utilizar un clasificador de éxito simple. Para tareas de pick-place, esto puede ser tan simple como verificar si el objeto está en la zona objetivo al final del episodio. Filtrar episodios fallidos antes del entrenamiento. En RCSV, ejecutamos una clasificación automática de éxito más revisión humana de todos los datos recopilados antes de la entrega. Incluso un 10% de demostraciones fallidas causa una caída del 20-30% en la tasa de éxito de las políticas.

Erro 4: Usar una sola cámara

Una cámara fija única crea problemas de oclusión durante el acercamiento. Cuando el brazo robótico se mueve hacia el espacio de trabajo, puede bloquear la vista del objeto y el agarre simultáneamente, dejando la política sin información visual precisamente cuando necesita más detalles. Esto es particularmente dañino para las tareas de inserción donde los últimos 5 cm de acercamiento son críticos.

Cómo detectar: La política tiene éxito en el enfoque pre-agarrado pero falla durante la fase final de contacto de 2-5 cm. El análisis de los videos de falla muestra que el objeto objetivo está oculto por el brazo en el momento crítico.

Fix: Utilice una configuración de tres cámaras como línea de base: (1) cámara fija a la vista para una visión general del espacio de trabajo, (2) cámara de ángulo lateral para la relación entre el brazo y el objeto, (3) cámara montada en la muñeca para la zona de contacto. La cámara de muñeca es la única adición más impactante - le da a la política retroalimentación visual directa sobre el contacto de agarre que ninguna cámara externa puede proporcionar. Consulte nuestra guía de teleoperatoria (T5) para obtener detalles sobre la configuración de la cámara.

Erro 5: Poca posicionamiento de objetos aleatorios

Muchos equipos recogen demostraciones con objetos en posiciones de inicio casi idénticas - el operador coloca el objeto en aproximadamente el mismo lugar antes de cada episodio. Esto entrena una política que funciona para objetos en esas posiciones exactas y falla cuando el objeto se desplaza 5 cm.

Cómo detectar: Alta tasa de éxito en las posiciones de distribución del entrenamiento (>90%) pero rápida degradación con perturbaciones de posición incluso pequeñas.

Fix: Antes de cada episodio, coloque el objeto objetivo en una posición aleatoria dentro del espacio de trabajo accesible. Utilice una cuadrícula o zonas marcadas para garantizar una cobertura sistemática. Para las tareas sensibles a la orientación (inserción, montaje), también se debe realizar una orientación aleatoria: al menos 8 orientaciones de inicio distintas distribuidas uniformemente.

Erro 6: Falta de datos de fase de contacto

Muchas tareas tienen fases distintas: acercamiento, contacto, manipulación, liberación. Los operadores a menudo se apresuran a través de la fase de contacto (el momento en que el agarre toca el objeto) porque se siente intuitivo para ellos. Pero esta es precisamente la fase en la que la política necesita más datos. Cuando las manifestaciones pasan por la fase de contacto en 2-3 pasos, la política casi no tiene señal de entrenamiento para el momento más crítico de la tarea.

Cómo detectar: La política realiza el enfoque correctamente (moverse a la posición correcta) pero falla en el momento del contacto - las agarres son inestables, las inserciones faltan, las colocaciones están apagadas. Examina el tiempo de demostración: si la fase de contacto (del primer contacto a la agarre estable) es <5 pasos en 50Hz, tienes este problema.

Fix: Instruir a los operadores a ralentizar durante la fase de contacto. Un protocolo útil: acercarse a una velocidad normal, ralentizarse hasta una velocidad del 50% cuando el agarre está a menos de 3 cm del objeto, y mantener una velocidad lenta a través del contacto hasta que se alcance una agarre estable. Esto da a la política 3-5 veces más señal de entrenamiento para la fase crítica. Alternativamente, recoger demostraciones adicionales que comienzan justo antes de la fase de contacto (el agarre ya está posicionado cerca del objeto).

Error 7: Evaluación sólo en la distribución de la formación

Una política que alcanza una tasa de éxito del 90% en las instancias y posiciones exactas en las que se ha formado puede alcanzar el 30% en condiciones ligeramente diferentes.

Cómo detectar: Si no ha evaluado en condiciones de mantenimiento, tiene este problema por definición.

Fix: Antes de finalizar una política, ejecuta una evaluación en tres condiciones: (1) nuevas instancias de objetos de la misma categoría (color, tamaño, textura diferentes), (2) nuevas posiciones de inicio fuera de la distribución de la formación, (3) diferentes superficies de fondo/tabla.

Erro 8: Ignorar el error de composición

Las políticas de clonación de comportamiento sufren de un error composto: pequeños errores se acumulan con el tiempo, empujando al robot a estados que nunca se vieron durante el entrenamiento. La política no tiene datos para recuperarse de estos nuevos estados, por lo que toma otra mala decisión, lo que conduce a un estado aún más nuevo, y así sucesivamente. Para tareas de más de 5 a 10 segundos, esto puede causar un fracaso completo incluso cuando los primeros pasos parecen correctos.

Cómo detectar: La política comienza bien pero se deteriora con el tiempo dentro de un solo episodio. Los primeros 2-3 segundos se ven bien; por segundo 5-8, el robot está en un estado irrecuperable.

Fix: Dos enfoques concretos. Chunking de acción (como se usa en [ACT](T6)) predice 20-100 acciones futuras a la vez y las ejecuta en bucle abierto, reduciendo las llamadas de inferencia y limitando la composición. ** Ensembling temporal** promedia predicciones de múltiples acciones recientes para una ejecución más fluida. Para tareas muy largas (> 30 años), considere políticas jerárquicas que dividan la tarea en subtareas de 3-5 años, o recopilación de datos en línea al estilo DAgger para reunir demostraciones de recuperación.

Erro 9: Elegir el espacio de acción equivocado

El espacio de acción - lo que la política predice en realidad - tiene un efecto sorprendentemente grande en el rendimiento. Las dos opciones comunes son las acciones del espacio conjunto (posiciones conjuntas de objetivo) y las acciones del espacio cartesiano (posiciones de efecto final de objetivo). La elección incorrecta para su tarea crea dificultades innecesarias para la política.

Cómo detectar: Las políticas se entrenan bien (bajas pérdidas) pero producen movimientos tirantes o físicamente improbables en el despliegue.

Fix: Utilice acciones de espacio conjunto (posiciones conjuntas de objetivo) como el predeterminado para los datos de teleoperación líder-seguidor, ya que el brazo líder produce naturalmente objetivos de espacio conjunto. Utilice acciones de espacio cartesiano solo si su tarea tiene una estructura geométrica fuerte que es más fácil de expresar en coordenadas cartesianas (por ejemplo, dibujar una línea recta). En concreto, para ACT, la implementación original utiliza acciones de espacio común y este es el estándar recomendado.

# Joint-space vs Cartesian-space action -- use joint-space by default
# This is how RCSV records actions for ACT training:

# GOOD: Joint-space action (7-dim: 6 joints + gripper)
action = leader_arm.get_joint_positions()  # Direct from leader arm
# Stored as: [j1, j2, j3, j4, j5, j6, gripper_width]

# AVOID (unless you have a specific reason):
# Cartesian-space action (7-dim: xyz + quaternion)
# action = robot.get_ee_pose()  # Requires IK at deployment
# IK solutions may be non-unique, introducing discontinuities

Erro 10: Saltar el volante de datos

Los equipos con las mejores políticas no son los que recopilan más datos por adelantado, son los que mejoran continuamente sus datos basados en los modos de falla observados. Una vez recopilado más una vez entrenamiento produce una política congelada en la calidad de su conjunto de datos inicial.

Cómo detectar: Ha entrenado una política, funciona a una tasa de éxito de X%, y desde entonces no ha recopilado datos adicionales.

Fix: Construir una rueda de control de datos desde el primer día. Implemente la política, registre cada falla, revise las fallas semanalmente, identifique las 3 principales categorías de modos de falla, recoge 50-100 demostraciones dirigidas que cubren esos modos de falla, retrain. Incluso 50-100 demostraciones de recuperación de fallas dirigidas por iteración pueden mejorar drásticamente la robustez. La RCSV plataforma de datos hace que este bucle sea eficiente: los registros de fallos se alimentan directamente en las colas de tareas de recogida, y los operadores recopilan demostraciones dirigidas contra categorías específicas de fallos.

Lista de control de calidad de los conjuntos de datos

Antes de entrenar, verifique que su conjunto de datos pasa todas estas verificaciones:

  • [ ] El número de episodios cumple con el umbral de dificultad -- L1: 50+, L2: 300+, L3: 1000+, L4: 5000+
  • [ ] Filtrados los episodios fallidos -- <5% de fallas en el conjunto de entrenamiento después del filtrado
  • [ ] Objeto posea aleatoriamente -- las posiciones de inicio cubren > 80% del espacio de trabajo de despliegue
  • [ ] Iluminación controlada o aumentada -- iluminación constante durante la recogida O aumento agresivo planeado
  • [ ] Configuración de múltiples cámaras - mínimo de 2 cámaras (capas superiores + muñecas), idealmente 3
  • [ ] Tempos monótonicos y sincronizados -- Alineación observación-acción dentro de 10 ms
  • [ ] Fases de contacto adecuadamente muestrada -- > 5 pasos desde el primer contacto hasta la captura estable
  • [ ] Ningún operador identificó artefactos -- revisar 10 episodios aleatorios para dudar, correcciones o patrones inusuales
  • [ ] Listo de trayectoria dentro de los límites -- movimiento medio por debajo del umbral específico de la tarea
  • [ ] Se preparó un conjunto de evaluaciones mantenidas -- 30-50 episodios con nuevas condiciones reservadas para las pruebas

La mayoría de estas comprobaciones se hacen automáticamente en el sistema de recopilación de datos de RCSV. Para los equipos que recopilan sus propios datos, esta lista de verificación debe revisarse antes de cada carrera de entrenamiento.

Lectura relacionada

Corre tu línea de datos antes de arreglar tu algoritmo

Los servicios de recopilación de datos de RCSV proporcionan demostraciones multicámaras de calidad filtradas con clasificación automática del éxito y la lista de verificación completa de calidad aplicada por defecto.

[Explorar los Servicios de Datos] [T14] [Hablar con un Ingeniero] [T15]