Equipos de recopilación de datos de robots de escala: de 1K a 100K demostraciones
Lecciones operativas de equipos de teleoperación de escala <unk> niveles de operadores, control de calidad a escala, opciones de infraestructura y curvas de costos por demostración.
[← Blog]
Cómo disminuye la calidad, dónde aparecen los cuellos de botella y cómo se ve la curva de costos a medida que escalas de cientos a decenas de miles de demostraciones de robots.
La caída de la calidad: tres señales de advertencia
La mayoría de los equipos que recopilan datos de robots se encuentran en la misma pared alrededor de la marca de 1,000 demostraciones. Hay tres señales concretas que predicen una crisis de calidad antes de que llegue completamente: picos de variación entre operadores (la misma tarea produce estilos de trayectoria muy diferentes entre operadores), aumentos de tasa de rechazo por encima del 40% (su tubería automática está descartando casi la mitad de los datos recopilados) y aparecen cuellos de botella en la tubería (las etapas de almacenamiento, preprocesamiento o revisión comienzan a hacer cola en días de retraso).
La causa raíz es consistente: los equipos escalarán el número de empleados sin un primer proceso de escala. Agregar un quinto o décimo operador a un protocolo no definido amplifica la inconsistencia en lugar de la capacidad de producción. La solución es estructural, y comienza con el nivel.
Reclutamiento de operadores: qué buscar
El único mejor predictor de la calidad del operador es la experiencia en el control motor fino, no el conocimiento de la robótica. Los operadores de RCSV de alto rendimiento provienen de orígenes en tecnología quirúrgica, higiene dental, relojería, juegos competitivos y rendimiento de instrumentos musicales.
Criterios específicos de detección que se relacionen con el éxito del operador:
- ** Prueba manual de destreza:** Tabla de inserción de peg sin tiempo (30 pegs en menos de 60 segundos elimina el 40% inferior de los candidatos). Esta prueba de 15 dólares predice un rendimiento de recogida mejor que cualquier examen de currículum.
- ** Atención sostenida:** Capacidad para mantener un rendimiento constante en sesiones de 2 horas.
- Cumplimiento del protocolo: Disponibilidad de seguir procedimientos de reinicio precisos. Los operadores creativos que improvisan son una responsabilidad a escala
se necesita operadores que ejecuten el protocolo de manera idéntica en el episodio 400 como en el cuarto. - ** Razonamiento espacial:** Capacidad para mapear los movimientos de sus manos en el marco de coordenadas del factor final del robot.
Evite la sobreindexación en el contexto de la robótica. Los estudiantes de doctorado en robótica a menudo hacen operadores mediocres porque quieren entender y optimizar el sistema en lugar de ejecutar demostraciones repetitivas.
El plan de estudios de cinco días para los operadores
RCSV desarrolló este plan de estudios después de incorporar a más de 40 operadores en múltiples tipos de campañas.
Día 1: Seguridad y orientación de hardware (4 horas)
- Localización y procedimiento de la parada electrónica en cada estación de robot
- Identificación de puntos de pincha en los brazos del líder y del seguidor
- Secuencias de apagado y protocolos de fallos de hardware
- Routing de cables de cámara y sensores
qué no tocar - ** Prueba de puerta:** Ejecutar el interrumpimiento de emergencia y el apagado completo en un plazo de 5 segundos desde cualquier posición de funcionamiento
Día 2: Familiarización de la interfaz de teleoperación (6 horas)
- Mapeo de articulaciones del brazo del líder
comprensión de qué articulaciones del líder controlan qué articulaciones del seguidor - Práctica de control de pegamento
tiempo de apertura/closure, pegamento parcial - Movimiento en el espacio libre: mover el efecto final a 20 posiciones objetivo en el espacio de trabajo sin ponerse en contacto con nada
- Conciencia de los límites del espacio de trabajo
límites conjuntos, evitación de singularidades - ** Prueba de puerta:** Completa 10 tareas que llegan al espacio libre en menos de 3 minutos sin violaciones de los límites del espacio de trabajo
Día 3: Formación específica de tareas (6 horas)
- Demonstraciones de relojes de oro estándar (top 10 de la serie de calificación de plomo)
- Revisar el documento escrito de criterios de éxito con ejemplos visuales
- Tarea de práctica bajo supervisión
20 demostraciones con retroalimentación en tiempo real - Revisar la reproducción de las propias demostraciones junto con el estándar oro
- ** Prueba de puerta:** 10 demostraciones consecutivas con una tasa de aceptación del primer paso de > 80% (a juzgar por el plomo de calificación)
Día 4: Normas de calidad y autoevaluación (4 horas)
- Revisar las métricas de calidad: distancia DTW, duración del episodio, puntuación de suavidad
- Práctica de autoetiquetado: revisión de los propios episodios y etiquetado de éxito/fallo
- Calibración del acuerdo entre los anotadores: conjunto compartido de 50 episodios, comparación con las etiquetas de oro
- ** Prueba por puerta:** Acuerdo entre los anotadores con plomo de calificación superior al 90% sobre las etiquetas de éxito/fallo
Día 5: Flujo de trabajo y calibración de la producción (4 horas)
- Flujo de trabajo completo de producción: procedimiento de restablecimiento, inicio/stop del episodio, entrada de metadatos, auto-control de calificación
- Línea de base de rendimiento: 20 demostraciones completas a ritmo de producción, medida por tiempo de demostración
- Manejo de la fatiga: protocolo de descanso programado (15 minutos cada 90 minutos)
- ** Prueba de puerta:** 20 demostraciones consecutivas de calidad de producción dentro del objetivo de rendimiento para la categoría de tarea
Los operadores que no logran una prueba de puerta repiten la formación de ese día. En nuestra experiencia, aproximadamente el 15% de los candidatos se deshacen en el tercer día (execución de tareas) y otro 5% en el quinto día (transmisión sostenida). El 80% que finaliza el plan producen datos que cumplen con los estándares de calidad de su primera sesión de producción.
Indicadores de referencia de rendimiento por nivel de operador y tipo de tarea
Estos índices de referencia se basan en datos de producción de RCSV en más de 30 campañas. "Throughput" es demostraciones netas utilizables por hora
| Task Type | Expert Operator | Trained Operator | New Operator (post-training) | Reset Time |
|---|---|---|---|---|
| Simple pick-place (single arm) | 10-12 demos/hr | 7-9 demos/hr | 4-6 demos/hr | 15-20s |
| Multi-object sorting | 8-10 demos/hr | 5-7 demos/hr | 3-5 demos/hr | 30-45s |
| Bimanual coordination | 6-8 demos/hr | 4-6 demos/hr | 2-4 demos/hr | 45-60s |
| Precisión insertion (±1mm) | 5-7 demos/hr | 3-5 demos/hr | 1-3 demos/hr | 30-45s |
| Deformable object manipulation | 4-6 demos/hr | 2-4 demos/hr | 1-2 demos/hr | 60-90s |
| Mobile manipulation | 3-5 demos/hr | 2-3 demos/hr | 1-2 demos/hr | 90-120s |
La diferencia entre experto y nuevo operador es de 2-3 veces mayor en tareas simples, pero de 3-5 veces mayor en tareas complejas. Es por eso que el sistema de niveles importa
Sistema de nivel de operador
Una estructura de operador de tres niveles mapea el nivel de habilidad para la complejidad de las tareas y controla el costo sin sacrificar la calidad cuando importa.
- ** Operadores menores ($ 22 / hora):** Assignado a tareas simples de pick-and-place con bajos requisitos de destreza
alcances de un solo brazo, transferencias de superficie plana, recopilación repetitiva de contenedores. Capacidad de producción: 12 18 demos por hora. Tiempo de embarque: 4 horas incluyendo calibración en repeticiones de oro estándar. - ** Operadores mayores ($30/hora):** Manejar el montaje complejo, la coordinación bimanual, las tareas de inserción restringidas. Se espera que alcance una tasa de aceptación del 85% en el primer paso. Participar en sesiones de calibración semanales y puede marcar casos de protocolo ambiguo.
- ** CA Leads ($45/h):** Diseñar protocolos de tareas, definir el conjunto de demostraciones del estándar de oro, ejecutar sesiones de calibración, administrar umbrales de clasificadores automatizados y realizar una revisión final en lotes señalizados.
Flujo de trabajo de calidad: el oleoducto de calidad de tres puertas
En escala, la revisión manual de cada episodio no es factible. Un oleoducto de tres puertas atrapa problemas de calidad a un costo creciente, por lo que los controles automatizados baratos filtran los problemas obvios antes de que la revisión humana cara se ejecute en el resto.
Puerta 1: Verificación heurística automática (costo: ~ $ 0,001/episodo)
Se ejecuta inmediatamente después de que cada episodio se graba. Estas verificaciones son deterministas y rechazan episodios que son obviamente inválidos:
- Limites de duración: Episodio menor a 3s o más largo que la media de 3x para el tipo de tarea → rechazo
- Cumplimiento del sensor: Cualquier flujo de cámara tiene > 2 marcos caídos, o la brecha de registro de estado conjunto > 50 ms → rechazo
- Limites del espacio de trabajo: El factor final deja un envase definido del espacio de trabajo en cualquier punto → rechazar
- Estado de cordura del gripo: El gripo nunca se cierra durante una tarea de agarre, o se cierra durante una tarea de lugar → rechazar
- Pic de velocidad: La velocidad conjunta excede el 95o percentil del estándar oro establecido por >3x → bandera para la puerta 2
Por lo general, la puerta 1 rechaza entre el 5 y el 15% de los episodios en bruto y señala el otro 10-20% para una inspección más cercana.
Puerta 2: Clasificación de éxito basada en ML (costo: ~ $0.01/episodio)
Un clasificador ligero de CNN (ResNet-18 en los últimos 10 cuadros de la cámara de muñeca) predice el éxito / fracaso binario.
- Taxa de positivos reales (identifica correctamente el éxito): 92-96%
- Taxa negativa verdadera (identifica correctamente el fallo): 75-85%
- Episodios clasificados como "incertos" (confianza 0.3-0.7): 8-12% → enrutados a la Puerta 3
El clasificador se sintoniza intencionalmente para una alta precisión en la etiqueta de "éxito"
Puerta 3: Revisión de expertos humanos (costo: ~ $0.50-2.00 / episodio)
Los guiones de QA revisan todos los episodios señalados por Gates 1 y 2, además de una muestra aleatoria del 5% de episodios que pasaron ambas puertas (para calibración). La muestra aleatoria sirve como auditoría continua
Control de calidad a gran escala
El conjunto de demostraciones de la norma oro es la base de la calidad escalable. Para cada tarea, mantenga exactamente 50 demostraciones de la norma oro registradas por clientes potenciales de calidad en condiciones ideales. Estos sirven para tres propósitos: (1) incorporación de línea de base
Las sesiones semanales de calibración no son negociables para más de 10 operadores. Cada sesión dura 30
El clasificador de éxito automatizado capta aproximadamente el 60% de los fracasos en la práctica. Arquitectura típica: una CNN ligera en los últimos 10 cuadros del flujo de cámara de muñeca, salida binaria de éxito / fracaso, entrenada en más de 200 ejemplos etiquetados por tarea. La tasa de falso positivo importa más que el falso negativo aquí
Estructura de equipo para una campaña de demostración de 50K
Una campaña de 50.000 personas es un reto operativo serio.
| Role | Count | Responsibility | Shift Pattern |
|---|---|---|---|
| Campaign Manager | 1 | Schedule, budget, client comms, overall quality | Full-time |
| QA Lead | 2 | Protocol design, calibration sessions, Gate 3 review | Full-time, staggered shifts |
| Senior Operators | 4-6 | Complex tasks, bimanual, mentor junior operators | 6hr shifts, 2 shifts/day |
| Junior Operators | 8-12 | Simple pick-place, resets, structured variation execution | 6hr shifts, 2 shifts/day |
| Data Engineer | 1 | Pipeline maintenance, format conversion, storage management | Full-time |
| Hardware Tech | 1 | Robot maintenance, camera calibration, station setup | Full-time |
Linea de tiempo: Con 6 estaciones de robots que funcionan 2 turnos / día y un rendimiento promedio de 6 demos / hora / estación utilizables, la tasa de recogida en bruto es de aproximadamente 430 demos / día utilizables (cuentación de descansos, reset, sesiones de calibración y tiempo de inactividad del hardware). 50,000 demos requieren aproximadamente 116 días laborables
Hardware: 6 OpenArm 1 estaciones ($ 4,500 cada) o configuraciones equivalentes de líder-seguidor. 3 cámaras por estación (2 muñecas + 1 sobrecarga). NAS centralizado durante los primeros 3 meses, migración S3 en la marca de 30TB. Presupuesto total de hardware: $35,000-50,000 excluyendo la computación para la formación.
Gestión de la fatiga del operador
La fatiga es el asesino de la calidad silenciosa. Los datos de producción del RCSV muestran un patrón consistente: la calidad de la demostración (medida por la distancia DTW del estándar oro) se degrada en 15-25% después de 90 minutos de recogida continua. Después de 3 horas, la calidad cae un 40% y las tasas de rechazo se duplican.
Protocolo de interrupción obligatorio para todos los operadores:
- Interrumpción de 15 minutos cada 90 minutos (fuera de la estación, sin revisar datos en la computadora)
- Pausa de 30 minutos después de 3 horas de tiempo de recogida acumulado
- Se recogerán un máximo de 6 horas por turno, con un máximo de 4,5 horas de tiempo de práctica real en el mando
- Ejercicios de estiramiento de muñeca en cada descanso (reducen el riesgo de tensión repetitiva)
Algunos equipos intentan empujar a los operadores a realizar turnos de recogida de 8 horas. Esto es contraproducente.
Infraestructura: NAS centralizada frente a S3
Con menos de 50 TB de datos recopilados, una NAS centralizada con RAID-6 es operacionalmente más simple y significativamente más barata a aproximadamente $0.01 / GB / mes frente a los $0.023 / GB / mes de S3. Obtienes acceso aleatorio de baja latencia para la revisión y repetición de episodios.
Por encima de 50TB
Tres pasos de automatización de la tubería proporcionan las mayores ganancias de rendimiento: (1) conversión automática de HDF5-a-Zarr para formato listo para el entrenamiento, (2) deduplicación de episodios a través de hash perceptual en miniaturas de cámaras de agarre (captura fallos del controlador que re-graban el mismo movimiento) y (3) extracción de metadatos (pose de objeto, etiqueta de éxito, ID del operador, duración) en un índice PostgreSQL para la consulta.
Arquitectura de tuberías de datos para escala
En 50K+ demos, su pipeline de datos debe manejar la ingestión, validación, anotación, almacenamiento y exportación sin intervención humana en el camino feliz.
Estación de robot → Agente de grabación (HDF5 por episodio) ↓ Cuesta de ingestión (Redis) ↓ Puerta 1: Validador heurístico (Python, 50ms/episodio) ↓ Pasar/rechazar Puerta 2: Clasificador de éxito (ResNet-18, GPU, 200ms/episodio) ↓ Pasar/incertado/rechazar Extractor de Metadatos → Índice PostgreSQL ↓ Objeto de almacenamiento (NAS → S3 en 50TB) ↓ Conversor de formato de lote nocturno (HRob5 → Zarr / Leot / RLDS) ↓ Exportación API → Descarga de cliente / HuggingFace Push
El principio clave del diseño: el agente de grabación en cada estación de robot escribe archivos HDF5 autónomos con todos los datos y metadatos del sensor. La tubería descendente es un procesamiento puramente basado en archivos sin depender del robot en línea.
Curva de costo por demografía
La economía de escala es real, pero requiere una inversión deliberada en infraestructura para realizarla.
| Scale | Per-Demo Cost | Key Cost Driver |
|---|---|---|
| 100 demos | $80/demo | Setup amortization, no automation benefit |
| 1,000 demos | $45/demo | Pipeline automation kicks in, NAS amortized |
| 10,000 demos | $25/demo | Full tier utilization, S3 lifecycle savings |
| 50,000 demos | $16-20/demo | Cross-task operator scheduling, batch QA |
| 100,000 demos | $12–18/demo | Projected — requires dedicated QA software tooling |
La caída más pronunciada ocurre entre 100 y 1.000 demostraciones a medida que amortiza los costos de instalación y desarrollo de tuberías. La siguiente inflexión significativa ocurre alrededor de 5.000 demostraciones cuando la clasificación automática de calidad alcanza la precisión suficiente para reemplazar la mayoría de la revisión manual. Más de 10.000, las ganancias provienen principalmente de mejoras en la utilización del operador
El costo oculto a menudo se pierde: mantenimiento de hardware. En 50K + demos, espera reemplazar las almohadillas de agarre cada 2.000 demos ($ 15-50 por reemplazo), recalibrar las cámaras mensualmente ($ 200 / estación en tiempo técnico), y presupuesto para una reparación de brazo importante por 10.000 demos ($ 500-2,000 dependiendo de la articulación). Presupuesto de 8-12% del costo total de la colección para el mantenimiento.
Comenzando
Si planeas escalar más allá de 500 demostraciones, invierta en la documentación del protocolo y la infraestructura de calibración antes de contar con personal. El costo marginal de un segundo operador en un protocolo no definido es mayor que el valor añadido que añaden.
El servicio de recopilación de datos de RCSV (en inglés: Data Collection Service) proporciona equipos de operadores administrados, diseño de protocolos e infraestructura de control de calidad diseñada específicamente para equipos que necesitan escala sin construir la organización de operaciones desde cero. Las campañas piloto comienzan a $2,500 para 200 demostraciones con QA completo. Las campañas a escala completa tienen un precio por demo con niveles de volumen que coinciden con la curva de costos anterior.
Para equipos que construyan sus propias operaciones: comience con 2 operadores y 1 líder de calidad en una sola estación [OpenArm 1]
Lectura relacionada
- [¿Qué es los datos de entrenamiento de robots?]
T5 ) -- Tipos, estándares de calidad y comparación de formato - [Guía de anotación de datos de robots]
T6 ) -- Normas de etiquetado y herramientas - Configuración de cámara robótica -- Configuración de varias cámaras para la recogida
- [Por qué los datos de teleoperación superan a la simulación]
- Servicios de datos del RCSV -- Recopilación gestionada desde $2,500
- OpenArm 1 -- $4,500 equipo de recolección de líderes y seguidores
- Robot Leasing -- Acceso mensual a las estaciones de recogida
- Plataforma de datos del RCSV -- Herramientas de tubería para la gestión de datos
¿Estás listo para escalar tu recopilación de datos?
El RCSV proporciona una recopilación de datos de robots gestionada con operadores profesionales, infraestructura de calidad y precios transparentes de costo por demostración.
[Explorar los Servicios de Datos]







