El volante de datos del robot en práctica: un estudio de caso del mundo real
Cómo un volante de datos robótico transforma el rendimiento de la política <unk> de 500 demostraciones de arranque a una línea de mejora continua, con métricas reales.
[← Investigación]
De un 72% al 93% de la tasa de éxito utilizando 53% menos demostraciones que la colección inicial
¿Qué es el volante de datos del robot?
El volante de datos del robot es un ciclo de retroalimentación compuesto: recoger demostraciones, entrenar una política, implementarla, recoger los fallos, retrenar y repetir. Cada ciclo produce una política más fuerte con menos esfuerzo marginal que el anterior
Las cuatro etapas se repiten continuamente: (1) Collect
Este estudio de caso documenta una tarea real de pick-and-place que se ejecuta a través de cinco fases del volante. El robot: un brazo de 6 DOF con un agarre paralelo de mandíbula. La tarea: recoger un pequeño bloque de espuma de una posición fija y colocarlo en una contención a 40 cm de distancia. La colocación del objeto varía dentro de un radio de 10 cm. Todos los datos recopilados a través de [RCSV infraestructura de teleoperación]
Fase 1 Bootstrap: 500 demostraciones, 72% de referencia
Comenzamos con 500 demostraciones teleoperadas recopiladas en dos días por tres operadores. Los episodios tuvieron un promedio de 8 segundos. Los datos se utilizaron para entrenar un punto de control de la Política de Difusión desde cero con un codificador visual ResNet-18.
Protocolo de evaluación: 100 ensayos con la colocación de objetos muestrados al azar dentro del radio permitido.
| Phase | Total Demos | New Demos Added | Success Rate |
|---|---|---|---|
| Phase 1 — Bootstrap | 500 | 500 | 72% |
| Phase 3 — Failure Retrain | 640 | 140 | 88% |
| Phase 5 — Active Learning Retrain | 940 | 300 | 93% |
Una tasa de éxito del 72% en una simple tarea de pick-and-place suena baja. En la práctica es un punto de partida realista.
Fase 2 Minería de fracasos: 140 episodios, dos tipos de fracasos
Después de que la política de Fase 1 se implementara en el entorno de prueba durante una semana (desarrollo automatizado, sin presencia humana), el 28% de los 500 episodios registrados fueron clasificados como fallos por un clasificador de resultados
De 140 episodios de fracaso, dos grupos surgieron después de una revisión cualitativa:
- Casi perdido (80 episodios): El robot agarró con éxito el bloque y se movió hacia la basura, pero se liberó demasiado pronto o en el ángulo equivocado, causando que el bloque rebotara.
- Falta completa (60 episodios): El robot no logró agarrar en absoluto
La colocación del dedo estaba fuera del centro por 3 5 mm, típicamente cuando el bloque se colocaba en los extremos del radio permitido.
Los operadores revisaron los 140 episodios de fallas a través de la cola de revisión humana de RCSV. Para cada fallo, un operador observó el episodio fallido y luego grabó una demostración correctiva comenzando desde la misma posición inicial del objeto. Esto produjo 140 demos dirigidos que abordaban directamente los puntos más débiles de la política.
Fase 3 Reentrenamiento en Bootstrap + Echecos: 88% de tasa de éxito
La reentrenamiento en el conjunto de datos combinado de 640 demostraciones (500 originales + 140 dirigidos al fracaso) empujó la tasa de éxito al 88%
El enfoque dirigido al fracaso fue aproximadamente 2,9 veces más eficiente que la recogida aleatoria para cerrar la brecha del 72% al 88%.
Fase 4 Aprendizaje activo: colección con bandera de incertidumbre
Para la Fase 4 cambiamos a una variante de la política consciente de la incertidumbre. La política de difusión produce incertidumbre implícita a través del desacuerdo de conjunto
Más de 1.000 lanzamientos automatizados, el 20% (200 episodios) fueron marcados como de alta incertidumbre. Los operadores revisaron el conjunto marcado y recogieron demostraciones correctivas para 200 episodios adicionales. El criterio de aprendizaje activo aseguró que estas demostraciones cubrían brechas de distribución genuinas
Fase 5 Reentrenamiento final: tasa de éxito del 93%
La capacitación en todas las 940 demostraciones (500 arranques + 140 objetivos de fracaso + 200 aprendizaje activo) logró una tasa de éxito del 93%. La curva de aprendizaje se había aplanado visiblemente
Infraestructura necesaria para ejecutar el volante
El volante no es un problema de ML
- ** Registro de implementación:** Cada episodio del robot debe registrarse con RGB sincronizado, propriocepción y metadatos de resultado.
- Clasificador de resultados: Un clasificador rápido y confiable que etiqueta los episodios como éxito o fracaso automáticamente.
- ** Cuadra de revisión humana:** Una interfaz de usuario para que los operadores puedan ver episodios fallidos y grabar demostraciones correctivas. La cola debe mostrar a los operadores el estado inicial desde el que iniciar la demostración correctiva.
- Trigger de entrenamiento automático: Cuando se acumulan un número suficiente de nuevas demostraciones en la cola, el entrenamiento debe iniciarse automáticamente.
- Registro de modelos con retroceso: Los nuevos puntos de control deben ser versionados y comparados con los anteriores antes de la promoción.
Metricas clave: la curva de eficiencia demográfica
En este tipo de tarea, la relación empírica entre los demos totales y la tasa de éxito sigue una curva logarítmica. La "rejera" de la curva
El volante no cambia la forma de esta curva, sino que se asegura de que siempre se opera en la parte más empinada de la curva, apuntando directamente a los modos de falla, en lugar de diluir nuevos datos con demostraciones fáciles redundantes.
Comparación de los ingresos por inversión: Flywheel vs. Upfront Collection
Para alcanzar la tasa de éxito del 93% a través de una colección aleatoria puramente anticipada, nuestra extrapolación de la curva de aprendizaje sugiere que se necesitarían aproximadamente 2.000 demostraciones.
En la tasa de recogida estándar de RCSV de $4
Explore cómo RCSV puede implementar la rueda de control de datos para sus programas de robots a través de nuestros [servicios de recopilación de datos]
Inicie su volante de datos
RCSV proporciona una infraestructura de volante de datos de extremo a extremo
[Explorar los Servicios de Datos]







