Volver a Blog

¿Qué hace buenos datos de entrenamiento de robots?

Un marco práctico para la calidad de los datos de entrenamiento de robots: las 6 dimensiones de diversidad, consistencia, integridad, precisión, equilibrio y formato, además de una lista de control de 10 puntos.

[← Blog]

Las 200 excelentes demostraciones superan constantemente a las 2.000 mediocres. La diferencia se reduce a seis dimensiones medibles de calidad que cada equipo debe rastrear.

El problema de la basura en la basura para las políticas de robots

El aprendizaje de imitación es un problema de distribución de coincidencia: la política entrenada aproximará la distribución de los comportamientos en sus datos de formación. Si esa distribución incluye capturas fallidas, movimientos sin sentido, estrategias inconsistentes y criterios de éxito ambigüos, la política aprende fielmente a reproducirlos todos. A diferencia de la formación de modelos de lenguaje, donde los ejemplos ruidosos individuales son suavizados por miles de millones de otros ejemplos, los [ensambles de datos de demostración de robots]T1) son lo suficientemente pequeños como para que cada episodio importe.

Un conjunto de datos de 500 demostraciones cuidadosamente controladas producirá una mejor política que un conjunto de datos de 5.000 demostraciones no controladas. Esta no es una afirmación aspiracional - es un hallazgo empírico consistente en grupos de investigación, tipos de tareas y arquitecturas de políticas. La explicación es simple: un conjunto de datos limpio, diverso y consistente da a la política una señal clara sobre lo que aprender. Un conjunto de datos ruidosos, sesgados e inconsistentes da a la política una señal confusa que resuelve mediando sobre comportamientos contradictorios, produciendo un rendimiento mediocre en todo en lugar de un rendimiento fuerte en cualquier cosa.

El marco siguiente identifica seis dimensiones que distinguen los datos de demostración de robots de alta calidad de los datos mediocres.

Dimensión 1: Diversidad

La diversidad es la dimensión de calidad más importante porque determina directamente [cuán bien generaliza la política] T2). Un conjunto de datos debe incluir variación en todos los ejes que diferirán entre el entrenamiento y la implementación: instancias de objetos, posiciones de objetos, condiciones de iluminación, desorden de fondo y comportamiento del operador.

** Diversidad de objetos:** Incluye al menos 10-20 instancias distintas de cada categoría de objeto objetivo, que varían en tamaño, color, material y marca. Si su tarea consiste en recoger copas, recoge demostraciones con tazas de cerámica, tazas de papel, tazas de viaje de plástico, tazas de vidrio y tazas de metal. Cada instancia enseña a la política algo diferente sobre las propiedades visuales y físicas de la categoría.

** Diversidad de posición:** Varias posiciones de inicio de objetos en todo el espacio de trabajo accesible, utilizando una cuadrícula de al menos 30 x 40 cm. Incluye diferentes orientaciones - vertical, inclinada, girada 90 grados. Si la política sólo ve objetos en el centro del espacio de trabajo durante el entrenamiento, fallará en los bordes durante el despliegue.

Diversidad de iluminación: Recogerse en al menos 3 condiciones de iluminación distintas: fluorescente superior caliente, luz diurna fresca de las ventanas y iluminación mixta o direccional. La iluminación es una de las fuentes más comunes de fallas de despliegue porque cambia la apariencia de cada objeto y superficie en la escena.

** Diversidad de operadores:** Utilice al menos 3 operadores distintos, cada uno contribuyendo a una proporción aproximadamente igual de demostraciones. Cada operador se acerca a la tarea de manera diferente - ángulos de aproximación diferentes, puntos de agarre, velocidades y estrategias de recuperación. Esta diversidad es valiosa porque obliga a la política a aprender la estructura de la tarea en lugar de las idiosincrasías de una sola persona.

Dimensión 2: Consistencia

La coherencia significa que la definición de tareas, los criterios de éxito y el procedimiento de restablecimiento son idénticos en todos los episodios.

Los criterios de éxito deben ser binarios e inequívocos. Para las tareas de pick-and-place, el éxito significa que el objeto está en la ubicación de destino dentro de una tolerancia definida al final del episodio. "Casi lo suficientemente cerca" no es un criterio. Escriba los criterios de éxito en su protocolo de recogida y verifique que todos los operadores los apliquen de la misma manera.

El procedimiento de restablecimiento debe estar estandarizado. Entre los episodios, los objetos deben colocarse en nuevas posiciones de partida de acuerdo con un protocolo de aleatorización definido, el espacio de trabajo debe ser limpiado de escombros o desplazamientos de la prueba anterior y el robot debe volver a una configuración de inicio consistente. Los resets de desaceleración introducen sesgos sistemáticos: objetos que se acumulan cerca de ciertos lugares porque los operadores no los colocan allí, desorden de fondo que se deriva a través de los episodios.

La calibración del operador es esencial. Antes de que las demostraciones de un operador cuenten hacia el conjunto de datos, deben completar una sesión de calibración de 2-4 horas para aprender la interfaz de teleoperación, internalizar los criterios de éxito y desarrollar estrategias de enfoque consistentes. Los operadores no calibrados producen demostraciones que perjudican activamente el desempeño de las políticas.

Dimensión 3: Completidad

Cada episodio debe capturar la tarea completa desde el enfoque inicial hasta la liberación final, con todos los flujos de sensores sincronizados y sin datos faltantes.

No faltan modalidades. Si la configuración de la colección incluye dos cámaras, codificadores conjuntos y un sensor de fuerza-torque, cada episodio debe tener las cuatro corrientes. Un solo episodio con una alimentación de cámara caída enseña la política de que la cámara que falta a veces es cero, lo que confunde la tubería de procesamiento visual.

Síncronizados timestamps. Todos los flujos de sensores deben estar alineados en el tiempo dentro del período de control (normalmente 5-20 ms). Los flujos desalineados crean un mapeo inconsistente entre lo que el robot ve y lo que hace - la acción en el tiempo T se empareja con la observación del tiempo T menos 50 ms, produciendo una señal de entrenamiento sistemáticamente desplazada. Verifique la sincronización automáticamente comprobando la alineación de timestamp en cada episodio.

Registración completa de episodios. Los episodios que comienzan a mediados de la sesión (porque la grabación se activó tarde) o terminan antes de la finalización de la tarea (porque la grabación se detuvo antes) son inutilizables para la mayoría de las líneas de entrenamiento de políticas. Configure su sistema de recogida para comenzar a grabar antes de que la tarea comience y detenerse después de que el robot regrese a su configuración inicial.

Dimensión 4: Precisión

La precisión abarca la exactitud de las demostraciones en sí y de los metadatos adjunctos.

Crecisión de demostración: Sólo los episodios de éxito total deben incluirse en el conjunto de capacitación de aprendizaje de imitación. El mecanismo es claro: la política aprende que "casi agarrar" o "abandonar a mitad de camino" es un estado terminal aceptable.

** Calidad de trayectoria:** Las demostraciones deben ser suaves, deliberadas y eficientes. Trayectorias torpes - causadas por errores del operador, latencia del controlador o mala ergonomía del espacio de trabajo - enseñan a la política a ser torpes. Medir la suavidad utilizando la métrica de jerk (tercera derivada de las posiciones conjuntas), establecer líneas de base por tarea de sus mejores operadores y filtrar demostraciones por debajo del 70% de esa línea de base.

Crecisión de la anotación: Las etiquetas de éxito/fallo, las etiquetas de instrucciones de lenguaje, la segmentación de fase de tarea y las etiquetas de identidad de objeto deben ser correctas. Las anotaciones incorrectas corrompen la señal de entrenamiento. Las instrucciones de lenguaje deben comprobarse con respecto al comportamiento real de la tarea ("recoger la taza roja" no debe ser etiquetado en un episodio en el que el operador recogió un tazón azul). Las herramientas de validación automática deben señalar las discrepancias entre las anotaciones y las observaciones.

Dimensión 5: Equilibrio

Un conjunto de datos equilibrado tiene una representación aproximadamente igual entre las condiciones.

** Balance de objetos:** Si usted tiene 15 instancias de objetos pero el 60% de las demostraciones utilizan 3 de ellos, la política aprende bien esos 3 objetos y los otros 12 mal.

** Balance de posición:** Si la mayoría de las demostraciones comienzan con objetos en el centro del espacio de trabajo, la política será débil en los bordes del espacio de trabajo.

** Balance de dificultad:** Aproximadamente el 10-15% de las demostraciones deben cubrir escenarios deliberadamente desafiantes: objetos al borde del alcance alcanzable, espacios de trabajo desordenados, orientaciones inusuales, recuperaciones cercanas a fallas. La subrepresentación de los casos de ventaja es una de las causas más comunes de fallas inesperadas en el despliegue.

Dimensión 6: Formatos

El formato de los datos determina la facilidad con que el conjunto de datos se integra con las líneas de formación, la eficiencia con que se puede almacenar y transferir y si es compatible con las normas comunitarias.

Use formatos establecidos. HDF5 o Zarr para el almacenamiento de episodios en bruto. El LeRobot HuggingFace formato para compartir y compatibilidad comunitaria. Desbloqueo esquema de X-Embodiment para la investigación de trans-embodiment. Los formatos personalizados crean fricción para cada consumidor en el flujo descendente y son la principal causa de "recopilamos datos pero no podemos usarlos" fallos.

Incluir metadatos completos. Cada episodio debe incluir: descripción de tarea, etiqueta de éxito/fallo, instrucción de lenguaje, identificador de plataforma del robot, intrínseca y extrínseca de la cámara, fecha de recogida, identificador del operador y cualquier condición ambiental que varíe (configuración de la iluminación, superficie de la tabla, ID de instancia de objeto). Estos metadatos permiten filtrar, analizar estratados y reentrenar de forma específica en condiciones específicas.

** Valida el formato automáticamente.** Ejecuta la validación de esquema en cada episodio en el momento de escribir. Recoger errores de formato durante la recopilación es mucho más barato que descubrirlos durante la capacitación, cuando un ingeniero pasa horas desactivando por qué el cargador de datos se estrella en el episodio 3.847.

Dimensión 7: Incluir en el caso de los fracasos

Esta dimensión es contraintuitiva: los buenos conjuntos de datos incluyen una proporción controlada de demostraciones de fallos. Mientras que la dimensión 4 (acurateza) requiere excluir las fallas del conjunto de capacitación primaria, un conjunto separado de demostraciones de fallas etiquetadas sirve funciones críticas para una formación política robusta.

Por qué son importantes los fracasos. Una política que se ha formado exclusivamente en demostraciones exitosas no tiene ninguna representación de lo que parece ser el fracaso. Incluyendo entre el 5-10% de demostraciones de fallas etiquetadas (seguramente etiquetadas como fallas en el conjunto de metadatos) se permiten varias técnicas de formación:

  • ** Aprendizaje contrastivo:** Entrenar a la política para distinguir las trayectorias de éxito de las trayectorias de fracaso, produciendo un límite de decisión más robusto.
  • ** Aprendizaje de comportamiento de recuperación:** Incluye demostraciones en las que el operador se encuentra con una condición de casi falla (objeto abandonado, falta de agarre) y se recupera. Estas "democraciones de recuperación" enseñan a la política qué hacer cuando las cosas salen mal, en lugar de solo qué hacer cuando las cosas van bien.
  • ** Detección de fallos:** Un clasificador separado formado en datos de éxito/fallo puede servir como monitor de tiempo de ejecución que desencadena la intervención humana cuando la política entra en un estado similar al fallo.

Cómo recopilar datos de fallas. No sabotear intencionalmente las demostraciones, sino conservar las fallas naturales que ocurren durante la recogida (cada operador tiene una tasa de fallas del 10-30%, especialmente al principio de una sesión) en lugar de descartarlas. Etiquetarlas con etiquetas de modo de falla: "pago perdido", "descargado durante el transporte", "ubicación incorrecta", "colisión con obstáculo". Esta etiquetación permite un análisis específico de las debilidades de las políticas y guía las prioridades de recolección.

Ratio recomendado: 85-90% de demostraciones exitosas en el conjunto de formación primaria, 5-10% de demostraciones de recuperación (casi fallo con recuperación exitosa) y 5% de demostraciones de fallo puro (resultados claramente fracasados). Las demostraciones de recuperación son las más valiosas por episodio porque enseñan a la política a manejar la distribución de estados que es más probable que encuentre cuando las cosas empiezan a salir mal.

Rubrico de calificación de la calidad de los datos

Dimension Score 1 (Poor) Score 3 (Adequate) Score 5 (Excellent)
Diversity 1-2 objects, 1 lighting, 1 operator 5-10 objects, 2 lightings, 2 operators 15+ objects, 3+ lightings, 3+ operators
Consistency No written criteria, ad-hoc resets Written criteria, manual reset verification Written criteria, automated reset verification, operator calibration
Completeness Missing modalities in >5% of episodes All modalities present, sync within 50ms All modalities present, sync within 10ms, auto-validated
Accuracy No filtering; includes failed demos Binary success filter, basic smoothness check Automated success classifier, jerk filtering, annotation validation
Balance >5:1 ratio between most/least represented 3:1 max ratio, basic spatial coverage 2:1 max ratio, grid-based coverage, 10-15% edge cases
Format Custom format, missing metadata HDF5/Zarr, basic metadata LeRobot/RLDS compatible, full metadata, auto-validated at write
Failure Inclusion All failures discarded Failures preserved but unlabeled Labeled failures + recovery demos at 5-10% ratio

Un conjunto de datos con una puntuación promedio de 4+ en todas las siete dimensiones es de calidad de producción. Una puntuación de 3 en cualquier dimensión debe abordarse antes de ampliar la recopilación. Una puntuación de 1-2 en cualquier dimensión dañará activamente la formación política - arreglarlo antes de recopilar más datos.

Antipatrones comunes en la recopilación de datos de robots

Estos son los errores que el RCSV ve con mayor frecuencia en los conjuntos de datos presentados para la formación de políticas.

  • El "especial de estudiante de posgrado". Un operador, una condición de iluminación, objetos siempre en la misma posición de partida, datos recogidos durante una tarde. La política resultante funciona perfectamente en el laboratorio y falla inmediatamente en cualquier otro entorno.
  • La trampa de "cuantidad sobre calidad". 5.000 demostraciones recogidas lo más rápido posible sin filtración de calidad. 30% son capturas fallidas, 20% tienen trayectorias torpes de operadores cansados, 10% tienen problemas de sincronización de timestamp. La política resultante aprende el promedio de todos los comportamientos, que es mediocre en todo.
  • El error de "acumulación de demos". Recopilar 2.000 demostraciones antes de entrenar una sola política. Luego descubrir que los datos tienen un problema sistemático (ángulo de cámara equivocado, modalidad faltante, criterios de éxito inconsistentes) que requiere la recolección de todo el conjunto de datos.
  • **El sesgo "sólo fácil". * * Los operadores naturalmente se centran en posiciones de inicio y orientaciones de objetos fáciles porque producen demostraciones más rápidas y suaves. El conjunto de datos se vuelve sobre-representado en condiciones fáciles y sub-representado en los casos de ventaja que la política encontrará en la implementación.
  • **El problema de "fallo silencioso". * * La recopilación de datos continúa durante semanas, pero la calibración de la cámara se desvió el día 3, y nadie se dio cuenta porque no había monitoreo de calidad automatizado. Todos los datos después del día 3 tienen transformaciones extrínsecas sistemáticamente incorrectas.
  • ** La "pesadilla de conversión de formato".** Los datos recopilados en un formato personalizado, luego convertidos a HDF5 para entrenamiento. El script de conversión tiene un error sutil que cae cada décimo paso de tiempo. La política se ejerce sobre datos corruptos y falla en la implementación.

Detalle del oleoducto de garantía de calidad del RCSV

El tubo de calidad RCSV se ejecuta en cada episodio en el momento de la recogida - no como un paso de post-procesamiento de lote. Esto significa que los problemas de calidad se detectan en segundos de la realización de la demostración, permitiendo la retroalimentación inmediata del operador y la recolección.

Etapas del oleoducto:

  1. ** Validación de esquema (0.1s).** Verifica que todas las corrientes de datos requeridas están presentes, que los tipos de datos son correctos y que los metadatos del episodio están completos. Rechaza inmediatamente si falta alguna corriente.
  2. ** Verificación de sincronización de timestamp (0.2s).** Computa la alineación de timestamp en pares entre todos los flujos de sensores. Rechaza si cualquier flujo está desalineado por más de 10 ms (configurable por tarea).
  3. Clasificación de éxito (0,5 segundos). Un clasificador aprendido (entrenado en episodios previamente etiquetados de la misma tarea) predice el éxito/fracasos.
  4. Puntura de la suavidad de trayectoria (0,3 s). Computa la métrica de movimiento (tercera derivada de las posiciones conjuntas) y compara con las líneas de base por tarea establecidas durante la calibración del operador.
  5. Análisis de cobertura (0,5s). Incorpora el episodio en un espacio de características visuales (utilizando un codificador de visión pre-entrenado) y verifica la diversidad en relación con el conjunto de datos existente.
  6. ** Verificación de la integridad de los metadatos (0.1s).** Verifica que todos los campos de anotación requeridos están llenos: descripción de tareas, instrucción de lenguaje, ID del operador, condiciones del entorno.

La latencia total de QA: menos de 2 segundos por episodio. El operador ve un indicador verde/amarillo/rojo inmediatamente después de completar cada demostración, lo que permite una retroalimentación de calidad en tiempo real sin interrumpir el flujo de recogida.

La lista de control de calidad de los datos de 10 puntos

  1. Al menos 10 instancias de objeto distintas por categoría objetivo
  2. Al menos 3 condiciones de iluminación representadas
  3. Al menos 3 operadores que contribuyen a episodios aproximadamente iguales
  4. Criterios de éxito escritos aplicados de manera consistente en todos los episodios
  5. Protocolo de restablecimiento estandarizado documentado y seguido
  6. Todas las corrientes de sensores presentes y sincronizadas en cada episodio
  7. Captura completa del episodio desde la aproximación hasta la finalización
  8. Clasificación binaria de éxito con revisión humana en casos fronterizos
  9. Listo de trayectoria filtrado contra líneas de base por tarea
  10. Datos almacenados en un formato establecido (HDF5/Zarr/LeRobot) con metadatos completos

Si tu conjunto de datos pasa los 10 puntos, son datos de calidad de producción adecuados para entrenar políticas fiables. Si falla en cualquier punto, fija esa dimensión antes de recopilar más datos - más datos con el mismo problema de calidad producen más del mismo problema.

Cómo el RCSV asegura la calidad en la recogida gestionada

Todos los datos de demostración recogidos a través de [servicios de datos del RCSV]T4) pasan a través de un sistema automatizado de calidad que aplica todas las dimensiones descritas anteriormente. La línea de tuberías incluye: clasificación automática del éxito utilizando clasificadores aprendidos, puntuación de la suavidad con líneas de base específicas del operador, análisis de cobertura en el espacio de incorporación visual para verificar la diversidad de objetos y medio ambiente, verificación de sincronización de timestamp, validación de esquemas en cada episodio y revisión humana en todos los casos fronterizos.

Recibes datos de calidad certificados con puntuaciones de calidad por episodio, estadísticas de cobertura agregadas que muestran diversidad en todos los ejes, y un informe de calidad que documenta cómo funciona el conjunto de datos en cada una de las seis dimensiones. Esta certificación significa que puedes entrenar con confianza que tus datos cumplen con el estándar - en lugar de descubrir problemas de calidad tres semanas en una carrera de entrenamiento.

Para los equipos que construyen su propia infraestructura de recogida, el RCSV también ofrece auditorías de calidad de conjuntos de datos recogidos externamente. Aplicamos la misma línea de calidad a sus datos y proporcionamos un informe detallado que identifica las dimensiones que necesitan mejorarse. [Contacta con el equipo del RCSV]T5) para discutir sus necesidades de calidad de datos.

Lectura relacionada

  • Costos de recogida de datos de robots -- Planificación presupuestaria para la recogida de datos de calidad en primer lugar
  • [Guía de configuración de OpenArm]T7) -- Configurar el hardware para su primera campaña de recopilación de datos
  • [Guía de LeRobot]T8) -- Políticas de formación sobre sus conjuntos de datos certificados de calidad
  • [Políticas de robot de tiro cero vs. de pocos disparos] T9) -- Cómo la calidad de los datos afecta la eficiencia de ajuste fino de pocos disparos
  • Robot de privacidad y seguridad de datos -- Tratamiento responsable de datos sensibles durante la recopilación
  • [Futur del mercado de datos de robots]T11) -- Normas de calidad que dan forma al mercado emergente de datos
  • Servicios de datos del RCSV -- Recopilación de datos certificada de calidad con una línea de calificación automatizada

Obtenga demostraciones de robots certificadas de calidad

La línea de calidad del RCSV cubre las seis dimensiones, así que puedes entrenar con confianza que tus datos cumplen con el estándar.

[Explorar los Servicios de Datos]