Volver a Research

El volante de datos del robot en práctica: un estudio de caso del mundo real

Cómo un volante de datos robótico transforma el rendimiento de la política <unk> de 500 demostraciones de arranque a una línea de mejora continua, con métricas reales.

[← Investigación]

De un 72% al 93% de la tasa de éxito utilizando 53% menos demostraciones que la colección inicial una detallada observación del volante en acción.

¿Qué es el volante de datos del robot?

El volante de datos del robot es un ciclo de retroalimentación compuesto: recoger demostraciones, entrenar una política, implementarla, recoger los fallos, retrenar y repetir. Cada ciclo produce una política más fuerte con menos esfuerzo marginal que el anterior porque se está apuntando exactamente a los modos de fallo que exhibe su política actual, no tomando muestras aleatorias de todo el comportamiento posible del robot.

Las cuatro etapas se repiten continuamente: (1) Collect recopilar datos de demostración humana para la tarea objetivo; (2) Train entrenar o ajustar a la perfección una política sobre los datos recogidos; (3) Deploy ejecutar la política en un entorno real o semireal y registrar todos los episodios; (4) Mine fail identificar qué episodios fallaron, recopilar demostraciones correctivas y volver a la formación.

Este estudio de caso documenta una tarea real de pick-and-place que se ejecuta a través de cinco fases del volante. El robot: un brazo de 6 DOF con un agarre paralelo de mandíbula. La tarea: recoger un pequeño bloque de espuma de una posición fija y colocarlo en una contención a 40 cm de distancia. La colocación del objeto varía dentro de un radio de 10 cm. Todos los datos recopilados a través de [RCSV infraestructura de teleoperación]

Fase 1 Bootstrap: 500 demostraciones, 72% de referencia

Comenzamos con 500 demostraciones teleoperadas recopiladas en dos días por tres operadores. Los episodios tuvieron un promedio de 8 segundos. Los datos se utilizaron para entrenar un punto de control de la Política de Difusión desde cero con un codificador visual ResNet-18.

Protocolo de evaluación: 100 ensayos con la colocación de objetos muestrados al azar dentro del radio permitido.

Phase Total Demos New Demos Added Success Rate
Phase 1 — Bootstrap 500 500 72%
Phase 3 — Failure Retrain 640 140 88%
Phase 5 — Active Learning Retrain 940 300 93%

Una tasa de éxito del 72% en una simple tarea de pick-and-place suena baja. En la práctica es un punto de partida realista.

Fase 2 Minería de fracasos: 140 episodios, dos tipos de fracasos

Después de que la política de Fase 1 se implementara en el entorno de prueba durante una semana (desarrollo automatizado, sin presencia humana), el 28% de los 500 episodios registrados fueron clasificados como fallos por un clasificador de resultados una pequeña CNN entrenada en 200 marcos etiquetados a mano para detectar "bloqueo en la caña" vs "no en la caña".

De 140 episodios de fracaso, dos grupos surgieron después de una revisión cualitativa:

  • Casi perdido (80 episodios): El robot agarró con éxito el bloque y se movió hacia la basura, pero se liberó demasiado pronto o en el ángulo equivocado, causando que el bloque rebotara.
  • Falta completa (60 episodios): El robot no logró agarrar en absoluto La colocación del dedo estaba fuera del centro por 35 mm, típicamente cuando el bloque se colocaba en los extremos del radio permitido.

Los operadores revisaron los 140 episodios de fallas a través de la cola de revisión humana de RCSV. Para cada fallo, un operador observó el episodio fallido y luego grabó una demostración correctiva comenzando desde la misma posición inicial del objeto. Esto produjo 140 demos dirigidos que abordaban directamente los puntos más débiles de la política.

Fase 3 Reentrenamiento en Bootstrap + Echecos: 88% de tasa de éxito

La reentrenamiento en el conjunto de datos combinado de 640 demostraciones (500 originales + 140 dirigidos al fracaso) empujó la tasa de éxito al 88% una mejora de 16 puntos en 140 nuevas demostraciones. Para comparación, estimamos que lograr el 88% solo desde la Fase 1 habría requerido aproximadamente 400 demostraciones adicionales recopiladas al azar basadas en la pendiente de la curva de aprendizaje observada.

El enfoque dirigido al fracaso fue aproximadamente 2,9 veces más eficiente que la recogida aleatoria para cerrar la brecha del 72% al 88%.

Fase 4 Aprendizaje activo: colección con bandera de incertidumbre

Para la Fase 4 cambiamos a una variante de la política consciente de la incertidumbre. La política de difusión produce incertidumbre implícita a través del desacuerdo de conjunto añadimos un pequeño conjunto de tres cabezas de predicción del ruido y episodios marcados donde el desacuerdo entre cabezas sobre la trayectoria de acción prevista excedió un umbral.

Más de 1.000 lanzamientos automatizados, el 20% (200 episodios) fueron marcados como de alta incertidumbre. Los operadores revisaron el conjunto marcado y recogieron demostraciones correctivas para 200 episodios adicionales. El criterio de aprendizaje activo aseguró que estas demostraciones cubrían brechas de distribución genuinas principalmente orientaciones de objetos inusuales y colocaciones en el borde del espacio de trabajo.

Fase 5 Reentrenamiento final: tasa de éxito del 93%

La capacitación en todas las 940 demostraciones (500 arranques + 140 objetivos de fracaso + 200 aprendizaje activo) logró una tasa de éxito del 93%. La curva de aprendizaje se había aplanado visiblemente empíricamente, esta tarea parece alcanzar un límite cercano al 95% debido al ruido ambiental irreducible (parpadeo de luz, desgaste del pegamento con el tiempo).

Infraestructura necesaria para ejecutar el volante

El volante no es un problema de ML es un problema de infraestructura.

  • ** Registro de implementación:** Cada episodio del robot debe registrarse con RGB sincronizado, propriocepción y metadatos de resultado.
  • Clasificador de resultados: Un clasificador rápido y confiable que etiqueta los episodios como éxito o fracaso automáticamente.
  • ** Cuadra de revisión humana:** Una interfaz de usuario para que los operadores puedan ver episodios fallidos y grabar demostraciones correctivas. La cola debe mostrar a los operadores el estado inicial desde el que iniciar la demostración correctiva.
  • Trigger de entrenamiento automático: Cuando se acumulan un número suficiente de nuevas demostraciones en la cola, el entrenamiento debe iniciarse automáticamente.
  • Registro de modelos con retroceso: Los nuevos puntos de control deben ser versionados y comparados con los anteriores antes de la promoción.

Metricas clave: la curva de eficiencia demográfica

En este tipo de tarea, la relación empírica entre los demos totales y la tasa de éxito sigue una curva logarítmica. La "rejera" de la curva donde los rendimientos marginales caen bruscamente aparece alrededor de 600800 demos para la simple selección y ubicación. Más allá de la rodilla, cada mejoría adicional del 5% requiere 35x tantas demos como la mejoría del 5% anterior.

El volante no cambia la forma de esta curva, sino que se asegura de que siempre se opera en la parte más empinada de la curva, apuntando directamente a los modos de falla, en lugar de diluir nuevos datos con demostraciones fáciles redundantes.

Comparación de los ingresos por inversión: Flywheel vs. Upfront Collection

Para alcanzar la tasa de éxito del 93% a través de una colección aleatoria puramente anticipada, nuestra extrapolación de la curva de aprendizaje sugiere que se necesitarían aproximadamente 2.000 demostraciones.

En la tasa de recogida estándar de RCSV de $48 por demostración (dependiendo de la complejidad de la tarea), el ahorro en una sola tarea es de $4,240$8,480. Para una organización que despliega 10 comportamientos de robots distintos, el enfoque de la rueda de vuelo ahorra $42K$85K en costos de recogida de datos por generación de políticas antes de tener en cuenta la mejora continua que la rueda de vuelo produce después de la implementación.

Explore cómo RCSV puede implementar la rueda de control de datos para sus programas de robots a través de nuestros [servicios de recopilación de datos]T3) o la [Plataforma Sin Temor]T4) para las tuberías de datos autogestionadas.

Inicie su volante de datos

RCSV proporciona una infraestructura de volante de datos de extremo a extremo desde la recogida inicial de demostraciones hasta la minería automática de fallas y las tuberías de reentrenamiento.

[Explorar los Servicios de Datos]