Volver a Blog

¿Qué son los datos de entrenamiento de robots?

Los datos de entrenamiento de robots son el cuello de botella de la IA física. Aprenda los tipos de datos de robots, métodos de recopilación comparados, estándares de calidad que importan y errores comunes que cometen los equipos.

Los grandes modelos de lenguaje tenían Internet. Los coches autónomos tenían millones de kilómetros de conducción registrada. La IA física -- robots que manipulan objetos, ensamblan productos y trabajan junto a los humanos -- tiene un problema de datos. Los datos de entrenamiento de robots son al mismo tiempo la entrada más importante y el cuello de botella más difícil de todo el pipeline. Esta guía desglosará lo que son realmente los datos de entrenamiento de robots, los tipos que existen, cómo los equipos los recopilan y los estándares de calidad que separan los conjuntos de datos que producen políticas confiables de los conjuntos de datos que desperdician meses de esfuerzo de ingeniería.

Definición de los datos de entrenamiento de robots

Los datos de entrenamiento de robots consisten en episodios grabados de un robot realizando una tarea. Cada episodio captura flujos sincronizados de datos de sensores: imágenes de cámara (RGB y profundidad), posiciones y velocidades conjuntas, poses de efector final, estados de agarre, lecturas de fuerza-torque y las entradas de control que producen esos movimientos. Un episodio suele durar de 10 a 60 segundos y representa un intento completo de una tarea: alcanzar un objeto, agarrarlo, moverlo a un lugar objetivo y liberarlo.

Estos datos sirven como materia prima para [imitación de aprendizaje] (T0), donde una política de red neuronal aprende a mapear las observaciones (lo que el robot ve y siente) a las acciones (lo que el robot debe hacer a continuación) mediante el estudio de demostraciones exitosas. También se utiliza para ajustar los modelos de acción del lenguaje de visión (VLA) como [RT-2 y OpenVLA] (T1), y para definir funciones de recompensa para el aprendizaje de refuerzo. Sin datos de formación de alta calidad, ninguno de estos enfoques produce políticas desplegables.

La razón por la que los datos de entrenamiento de robots son un cuello de botella es que no se pueden extraer de Internet. Cada episodio requiere hardware físico que se ejecuta en un entorno físico con un operador humano calificado o un controlador cuidadosamente scriptado. Las tasas de recogida se miden en episodios por hora, no episodios por segundo. Un conjunto de datos típico de investigación contiene entre 100 y 10.000 episodios, órdenes de magnitud más pequeñas que los conjuntos de datos que impulsan los modelos de lenguaje o visión.

Tipos de datos de formación de robots

** Datos de demostración** es el tipo más común. Un operador humano controla al robot a través de la teleoperación o la enseñanza cinestética, y el robot registra sus flujos de sensores y las acciones resultantes. Es el estándar de oro para el aprendizaje por imitación y la salida principal de la mayoría de los programas de recopilación de datos.

** Datos de interacción** captura el robot ejecutando una política de forma autónoma y registrando los resultados. Estos datos incluyen tanto éxitos como fracasos y se utilizan para el aprendizaje en línea de refuerzo, la mejora iterativa al estilo DAgger e identificación de modos de fracaso. Los datos de interacción suelen ser de menor calidad que los datos de demostración por episodio, pero pueden recopilarse en mayor volumen ya que no requieren atención humana continua.

Los motores de física como NVIDIA Isaac Sim, MuJoCo y Genesis hacen que los entornos virtuales donde los robots simulados ejecutan tareas. Los datos sintéticos ofrecen un volumen ilimitado y una anotación perfecta, pero sufren de la [sim-to-real gap] T2) - las políticas entrenadas puramente en datos sintéticos a menudo fallan cuando se transfieren a hardware real porque la física simulada y la representación no coinciden perfectamente con la realidad.

** Datos de vídeo** provienen de actividades humanas grabadas -- videos de cocina, instrucciones de montaje, demostraciones de manipulación -- capturadas sin ningún robot presente. Los datos de vídeo son abundantes en Internet pero carecen de etiquetas de acción (el motor ordena que un robot necesitaría para reproducir el comportamiento). Es más útil para [pre-entrenamiento de representaciones visuales]T3) en lugar de entrenar directamente las políticas de robots.

Dimensiones de calidad de datos: lo que separa los datos utilizables del ruido

Después de trabajar con docenas de campañas de recopilación de datos en RCSV, hemos identificado seis dimensiones de calidad medibles que predicen si un conjunto de datos entrenará una política desplegable o desperdiciará meses de esfuerzo de ingeniería.

1. Consistencia de la demostración

La coherencia mide la similitud de las trayectorias de acción en las demostraciones de la misma tarea bajo las mismas condiciones. Matemáticamente, se puede cuantificar esto calculando la distancia de deformación en el tiempo dinámico (DTW) entre las trayectorias de los efectos finales de todos los pares de episodios en una condición, luego observando el coeficiente de variación. Un CV inferior a 0,15 entre los operadores en tareas de calibración indica una buena consistencia.

La inconsistencia surge de dos fuentes: la variación de las habilidades del operador y las definiciones ambiguas de tareas. La segunda requiere criterios de éxito escritos precisos -- no "poner la taza en el plato" sino "poner la taza en posición vertical en el plato con el mango hacia la derecha, centro dentro de 2 cm del centro de la placa, liberado desde una altura de no más de 1 cm".

2. Cobertura de los modos de falla

Un conjunto de datos que contiene solo demostraciones limpias y exitosas produce una política que nunca ha visto un estado de casi falla y no puede recuperarse de uno. Los mejores conjuntos de datos incluyen una proporción controlada de demostraciones de recuperación: el operador comienza intencionalmente desde posiciones ligeramente incorrectas, deja caer un objeto y vuelve a agarrar, o corrige una desalineamiento en medio de la tarea. Una división de 90/10 de los éxitos limpios a las demostraciones de recuperación es una buena relación de inicio. etiquetar los episodios de recuperación con metadatos para que puedan ponderarse por separado durante el entrenamiento.

Un conjunto de datos de 500 éxitos y 100 éxitos etiquetados es más valioso que 600 éxitos solos, porque los episodios de fracaso pueden entrenar clasificadores de éxito binarios, definir los límites de la distribución de tareas y proporcionar ejemplos negativos para enfoques de aprendizaje contrastivo.

3. Cobertura de la distribución de tareas

La distribución de tareas es el espacio de todas las condiciones de inicio, configuraciones de objetos y variaciones ambientales que la política encontrará en la implementación. Un conjunto de datos debe tomar este espacio de forma sistemática, no ad hoc. Define los ejes de variación explícitamente antes de recopilar:

Variation Axis Minimum Coverage Example Values
Object instances 10+ per category 10 different mugs, 12 different cans
Starting positions Full workspace coverage 5x5 grid across 40cm x 40cm workspace
Object orientations 4+ orientations per object 0, 90, 180, 270 degrees; upright and on side
Lighting conditions 3+ conditions Overhead fluorescent, side lamp, natural daylight
Background scenes 3+ backgrounds Clean table, cluttered workspace, different table color
Operators 3+ operators Distinct control styles, response speeds
Distractor objects Present in 30%+ of episodes Non-target objects in workspace

El conteo total de episodios se sigue del requisito de cobertura: si necesitas 10 episodios por condición única y tienes 10 objetos x 5 posiciones x 3 condiciones de iluminación, el tamaño mínimo del conjunto de datos es de 1.500 episodios.

4. Calidad temporal

Las vacilaciones, pausas y inversiones del operador durante las demostraciones introducen ruido en la distribución de la acción. Un operador experto que realiza una tarea de pick-and-place produce una trayectoria suave de 8 segundos. Un operador novato que realiza la misma tarea puede producir una trayectoria de 25 segundos con 3-4 pausas y una inversión de dirección. La demostración novato no es solo más lenta, sino que enseña a la política a pausar y revertir, que rara vez son comportamientos deseables. El filtro de calidad temporal elimina las demostraciones donde la duración total excede 2 veces la duración media de la tarea, o donde los perfiles de velocidad muestran patrones de vacilación característicos (velocidad cercana a cero para más de 500 ms en mitad de la tarea).

5. Calidad de sincronización de los sensores

Las configuraciones de múltiples cámaras y las corrientes de sensores mixtas (cámara + estados conjuntos + fuerza / par) deben ser sincronizadas a tolerancias ajustadas. Para las corrientes de imagen de 30 Hz, incluso un solo marco caído crea una brecha de 33 ms que desalinea las acciones con las observaciones. Para los datos de fuerza y par registrados a 1 kHz, la deriva del reloj entre el sensor F/T y el controlador de la cámara puede acumularse a cientos de milisegundos en un episodio de 60 segundos. La tubería de recogida de RCSV utiliza sincronización desencadenada por hardware (sincronización de hardware de Intel RealSense) y valida el tiempo inter-flujo al final de cada sesión de grabación. Los episodios con errores de sincronización superiores a 10 ms se marcan para la recolección.

6. Fidelidad espacial de acción

Las acciones registradas deben representar fielmente lo que el robot realmente hizo, no lo que el controlador ordenó. En los sistemas de teleoperación líder-seguidor, el brazo seguidor puede retrasar al líder en 20-50 ms y puede no rastrear perfectamente la trayectoria del líder debido a límites conjuntos, límites de par o respuesta dinámica. El registro de las acciones ordenadas (del líder) en lugar de las acciones ejecutadas (del seguidor) introduce un sesgo sistemático.

Las leyes de escala: ¿Cuántas demostraciones realmente necesitas?

La relación entre el tamaño del conjunto de datos y el rendimiento de las políticas sigue un patrón predecible, aunque los números exactos dependen de la complejidad de las tareas, la arquitectura de las políticas y la calidad de los datos.

Task Complexity Example Demos for 70% Success Demos for 90% Success Policy Architecture
Simple pick-place (1 object) Pick block, place in bin 30-50 100-200 ACT
Multi-object pick-place Sort 5 objects into bins 150-300 500-1,000 Diffusion Policy
Contact-rich single task Peg insertion, lid closing 100-200 300-500 Diffusion Policy + F/T
Bimanual coordination Fold towel, open bag 200-400 800-1,500 ACT (bimanual)
Language-conditioned multi-task "Pick the red cup," "stack blocks" 500-1,000 per task 2,000-5,000 per task VLA (OpenVLA, RT-2)
VLA fine-tuning (pre-trained) Adapt OpenVLA to new task 50-100 200-500 OpenVLA + LoRA

Una visión crítica de estudios de escalación recientes: duplicar el tamaño del conjunto de datos mientras se mantiene la constante de diversidad produce retornos disminuyentes después de los primeros 200-300 episodios. Esta es la razón por la cual los protocolos de recopilación de datos de RCSV (T5) priorizan la variación estructurada sobre el conteo de episodios crudos.

El volante de datos: de la recopilación a la mejora continua

Los equipos más avanzados no tratan la recopilación de datos como un evento único. Construyen una rueda de control de datos, un bucle continuo donde las políticas implementadas generan nuevos datos de interacción, esos datos se revisan y anotan, y se alimentan de nuevo en la próxima iteración de entrenamiento. La rueda de control tiene cuatro etapas:

Etapia 1: Seed dataset. Recolectar 200-500 demostraciones de alta calidad a través de la teleoperación. Ejercer una política inicial. Este es el conjunto de datos mínimo viable que hace que una política funcione, aunque imperfecta.

Etapia 2: Despliegue con registro. Implemente la política inicial sobre la tarea real con registro de sensores completo habilitado. Se registra cada ejecución autónoma, incluidas las fallas.

Etapia 3: Recopilación de fallos dirigidos. Analice los datos de implementación registrados para identificar los modos de fallas sistemáticos. Recopile demostraciones adicionales dirigidas específicamente a esas condiciones de fallas. Si la política falla en objetos de color oscuro, recopile 50 demostraciones con objetos oscuros. Si falla cuando el objetivo está cerca del borde del espacio de trabajo, recopile 50 demostraciones en posiciones de borde. Esta recopilación dirigida es 5-10 veces más eficiente que la ampliación uniforme de datos.

Etapia 4: Entrenamiento y repetición. Combine los datos dirigidos con el conjunto de datos original, entrenamiento y redistribución. Cada ciclo a través del volante produce una mejora medible en las áreas de rendimiento más débiles. Los equipos que ejecutan 3-5 iteraciones de volante suelen lograr tasas de éxito 15-25% más altas que los equipos que entrenan una vez en un conjunto de datos inicial grande.

La construcción de una rueda de vuelo de datos requiere infraestructura para registro continuo, detección automática de fallas y capacitación rápida. La plataforma de datos de RCSV proporciona las herramientas para gestionar este proceso iterativo en múltiples tareas y estaciones de robots.

Los métodos de recolección comparados

Teleoperación es el método de recolección dominante para la manipulación de datos de alta calidad. Un operador controla el robot de forma remota utilizando una configuración de seguidores de líder, un controlador VR, un ratón espacial o un guante de datos. El robot ejecuta los comandos del operador en tiempo real mientras registra todos los flujos de sensores. La teleoperación produce demostraciones naturales y fluidas que se generalizan bien porque el operador puede adaptar su estrategia a cada situación en tiempo real. Las tasas de recogida varían de 30 a 120 episodios por hora dependiendo de la complejidad de la tarea y el tiempo de restablecimiento.

Enseñanza cinestética implica guiar físicamente el brazo robótico a través del movimiento deseado mientras el robot está en un modo de complicación (compensación por gravedad). Este método es intuitivo y no requiere hardware de control externo, pero tiene limitaciones significativas: la mano del operador ocupa el espacio de trabajo de las vistas de la cámara, la aplicación de la fuerza es antinatural porque el operador está luchando contra la inercia del robot, y el método no se escala a tareas de manipulación bimanual o móvil. La enseñanza cinestética funciona mejor para tareas simples de pick-and-place con un solo brazo, donde la forma de la trayectoria es más importante que la dinámica precisa de contacto.

** Colección scripted** utiliza primitivas de movimiento predefinidas - puntos de aproximación, patrones de captura y secuencias de colocación - ejecutadas con parámetros aleatorios. Los datos escritos son útiles para iniciar políticas en tareas bien estructuradas como la selección de contenedores con objetos conocidos, pero rara vez se generaliza a situaciones nuevas.

Imitación de vídeo extrae demostraciones de videos humanos grabados utilizando el seguimiento de la mano, la estimación de la postura y la retargeting a la cinemática robótica. Este enfoque es todavía en gran parte experimental. Funciona razonablemente bien para los movimientos de brazos gruesos, pero falla en la manipulación fina porque la estimación de la postura de la mano no es lo suficientemente precisa y el mapeo de la encarnación humano-robótico introduce errores. Los equipos que exploren la imitación de vídeo deben tratarla como un complemento, no un reemplazo, de la recopilación de datos nativos de robots.

Tabla de comparación del método de recogida

Method Throughput Data Quality Hardware Cost Best For
Leader-follower teleop 5-12 demos/hr (expert) Highest $4,500-32,000 Dexterous, contact-rich tasks
VR controller teleop 8-15 demos/hr High $500-1,500 Pick-place, general manipulation
Kinesthetic teaching 3-8 demos/hr Medium $0 (uses robot) Simple trajectories, prototyping
Scripted + randomized 60-200 demos/hr Low-medium $0 (software) Structured tasks, pre-training
Video retargeting N/A (post-hoc) Low $0-500 Visual pre-training only

Los factores de calidad que realmente importan

** Diversidad** es el factor de calidad más importante. Un conjunto de datos de 200 episodios que cubren 15 instancias de objetos, 3 condiciones de iluminación y 3 operadores casi siempre producirá una mejor política que 2.000 episodios con un solo objeto en condiciones uniformes. Un conjunto de datos de manipulación robusto debe incluir, como mínimo, 10 o más instancias de objetos distintas por categoría, 3 o más condiciones de iluminación, posiciones de inicio variadas en todo el espacio de trabajo y múltiples operadores.

Consistencia significa que los criterios de éxito, el procedimiento de restablecimiento y la definición de tarea son idénticos en todos los episodios. La coherencia requiere un protocolo de recogida escrito, criterios claros de éxito que los operadores pueden aplicar de manera inequívoca, y un procedimiento de restablecimiento estandarizado entre episodios.

Correcidad de anotación cubre los metadatos adjuntos a cada episodio: etiquetas de éxito/fallo, etiquetas de instrucciones de lenguaje, segmentación de fase de tarea y etiquetas de identidad de objeto. Las anotaciones incorrectas corrompen la señal de entrenamiento. Las etiquetas de éxito binario deben ser verificadas por un segundo revisor para casos fronterizos. Las instrucciones de lenguaje deben ser verificadas con respecto al comportamiento real de la tarea. El proyecto de RCSV incluye una clasificación automática de los casos de éxito con revisión humana de todos los casos fronterizos.

** Completidad de los episodios** significa que cada episodio capta la tarea completa desde el enfoque inicial hasta la colocación final, con todos los flujos de sensores sincronizados y sin cadros caídos. Los episodios incompletos - donde la grabación comenzó a mediados de la racha, una cámara cayó, o estados conjuntos se registraron a una frecuencia diferente a las imágenes - introducen ruido que degrada el aprendizaje de políticas. La verificación de la sincronización debe ser un paso automatizado en cada línea de recogida.

Errores comunes que cometen los equipos al recopilar su primer conjunto de datos

Recolectar demasiados episodios con demasiada poca diversidad. Los equipos a menudo se fijan en los objetivos de conteo de episodios (1.000 episodios) sin controlar la diversidad. Establezca primero objetivos de diversidad - número de instancias de objetos, entornos, operadores - y deje que el conteo total de episodios siga de esos objetivos multiplicados por un mínimo por condición (normalmente 10-20 episodios por condición única).

Calibración del operador que deja de funcionar. Los operadores no capacitados producen demostraciones torpes e inconsistentes que perjudican activamente el rendimiento de la política.

No registrar episodios de fallas. Las demostraciones fallidas deben registrarse y etiquetarse, no descartarse. Los datos de fallas son valiosos para entrenar comportamientos de recuperación, construir clasificadores para detectar fallas inminentes y comprender dónde es más difícil su tarea.

** Ignorando la consistencia de restablecimiento.** Si el restablecimiento entre los episodios es descuidado - objetos colocados en aproximadamente el mismo lugar, desorden de fondo dejado de la prueba anterior - el conjunto de datos hereda sesgos sistemáticos. Invertir en un protocolo de restablecimiento repetible, incluyendo la colocación aleatoria de objetos dentro de una región definida, estado de fondo consistente, y una lista de verificación que los operadores siguen entre los episodios.

** Elegir el formato incorrecto.** El almacenamiento de datos en formatos personalizados crea fricción para todos los consumidores de abajo. Utilice formatos establecidos: HDF5 o Zarr para los datos de episodios en bruto, el LeRobot HuggingFace formato para compartir, y el esquema Open X-Embodiment para la investigación de los cuerpos cruzados. Convertir entre formatos más tarde siempre es más difícil que elegir el formato correcto por adelantado.

Inversión insuficiente en anotaciones. Muchos equipos omiten las anotaciones de lenguaje por completo o etiquetan los episodios con instrucciones idénticas copiadas y pegadas. Si planeas entrenar políticas de idioma o ajustar las VLAs, cada episodio necesita una instrucción única de lengua natural que describa con precisión lo que sucedió. "Recabar la taza roja del lado izquierdo de la mesa y colocarla en la placa azul" es una anotación útil. "Pick and place" no lo es. Consulte nuestra [guía de anotación]T8) para obtener estándares detallados.

Formatos de datos y normas de exportación

La elección del formato de almacenamiento adecuado afecta cada paso a la baja en tu pipeline.

Format Strengths Weaknesses Best Use Case
HDF5 (.h5) Random access, chunked compression, metadata support, mature tooling Single-writer lock, poor cloud streaming, no built-in versioning Local collection, ACT/Diffusion Policy training
Zarr Cloud-native, concurrent writes, chunk-level access, S3/GCS compatible Less mature ecosystem, no single-file portability Large-scale cloud datasets, Diffusion Policy reference implementation
RLDS (TFRecord) Streaming, Open X-Embodiment standard, TF ecosystem integration TensorFlow dependency, no random access, sequential read only Cross-embodiment sharing, OXE compatibility
LeRobot (HuggingFace) Standardized schema, Hub integration, streaming via datasets library, growing community Parquet overhead for small datasets, Hub dependency for sharing Community sharing, LeRobot framework training, VLA fine-tuning
ROS bag (.bag / .db3) Native ROS logging, preserves topic structure, replay support ROS dependency, not ML-ready, needs conversion for training Raw collection on ROS2 systems, debug replay

La recomendación de RCSV: recoger en HDF5 o bolso ROS para la máxima flexibilidad durante la fase de recogida, luego convertirlo en formato LeRobot para compartir y entrenar. Nuestra [plataforma de datos]T9) maneja la conversión de formato automáticamente y admite la exportación a los cinco formatos anteriores.

Requisitos de anotación por tipo de política

Las diferentes arquitecturas de políticas requieren diferentes capas de anotación.

ACT / Política de difusión (tarea única): Banderilla de éxito binario por episodio. Opcional: segmentación de fase de tarea para el descomposición. No se necesitan etiquetas de idioma. Costo de anotación: $0.02-0.05 por episodio.

** BC (BC-Z, RT-1):** Bandeja de éxito binario más instrucción de lengua natural por episodio. Las instrucciones deben distinguir las variantes de tareas.

VLA fine-tuning (OpenVLA, RT-2): Bandeja de éxito binaria, instrucción de lenguaje natural, y idealmente segmentación de fase de tarea. Las instrucciones de lenguaje deben variarse en la fraseo (no copiadas) para enseñar la generalización del lenguaje modelo.

** Políticas jerárquicas:** Segmentación completa de la fase de tarea con banderas de éxito de las subtareas. Cada límite de fase requiere una etiqueta de timestamp.

Para obtener directrices detalladas sobre anotaciones y recomendaciones sobre herramientas, consulte nuestra guía de anotaciones de datos de robots.

Comienza con los Servicios de Datos de RCSV

La construcción de un programa de datos de formación de robots desde cero requiere hardware, operadores, un entorno de laboratorio, software de recogida, herramientas de garantía de calidad y experiencia en ingeniería de datos. Para los equipos que necesitan datos más rápido de lo que pueden construir esta infraestructura, los [servicios de datos] de RCSV (T12) proporcionan la línea completa: operadores de recogida capacitados para su tarea específica, estaciones de hardware preconfiguradas con configuraciones de múltiples cámaras y detección de torque de fuerza, entornos de laboratorio controlados en San Francisco y Allston, y una línea de calidad que hace cumplir todos los estándares descritos anteriormente.

El camino más rápido es contactar al equipo de servicios de datos con su descripción de tarea, plataforma de robot objetivo y número de episodios deseados. RCSV maneja el diseño de protocolo de recogida, capacitación del operador, recopilación de datos, garantía de calidad, anotación y exportación en el formato preferido. La recopilación remota utilizando hardware alquilado por RCSV en su instalación también se admite para tareas que requieren su entorno o objetos específicos.

Si está planeando su primera campaña de recopilación de datos, comience con un piloto de 200-500 episodios para validar su definición de tarea y los estándares de calidad antes de escalar a miles. Los programas piloto de RCSV comienzan en $2,500 e incluyen diseño de protocolo, 200 demostraciones, informe de calidad y exportación en el formato elegido.

Las opciones de hardware incluyen el [OpenArm 1]T13 (US$4,500 para el kit líder-seguidor), [ALOHA-class bimanual setups]T14), y el [Unitree G1]T15) para la manipulación móvil. Para los equipos que prefieren arrendar en lugar de comprar, nuestro [programa de arrendamiento de robots]T16) proporciona acceso mensual a estaciones de recogida precalibradas.

Lectura relacionada