La lista de verificación de calidad de los datos de teleoperatoria que necesita cada laboratorio
Calibración, presupuesto de latencia, suavizamiento de la acción, etiquetado de recuperación de fallas, límites de episodios, elección de interfaz <unk> una lista de verificación del profesional para obtener datos de teleop de alta calidad.
Los datos de teleoperación son la materia prima para el aprendizaje moderno de los robots. También es el lugar más común donde los modelos en aguas subyacentes fallan silenciosamente. Esta es la lista de verificación que revisamos en cada laboratorio antes de enviar una póliza.
Publicado 2026-03-27 por el equipo de investigación del Centro de Robótica del Valle del Silicio.
TL;DR. La calidad de la política está limitada por la calidad de los datos. La calidad de los datos se determina principalmente por seis cosas: calibración, latencia, suavizamiento de la acción, disciplina de los límites de los episodios, etiquetado de recuperación de fallas y elección de interfaz. La mayoría de los laboratorios fallan en dos o tres de estos y no lo saben. ejecuta esta lista de verificación cada vez que comience una nueva tarea o una nueva campaña de recopilación de datos. Resolver los problemas en la fuente, no en el post-procesamiento.
1. Calibración: el requisito previo
Los errores de calibración contaminan cada señal de aprendizaje en el flujo descendente. Si el extrínseco de su cámara se deriva en 2 cm entre el martes y el jueves, las políticas entrenadas en el conjunto de datos conjunto aprenderán una distribución confusa de la posición del objeto.
Lista de verificación de calibración
- Ejecutar una calibración extrínseca al comienzo de cada sesión de recopilación de datos.
- Recalibra después de cualquier choque físico en el robot o en la cámara.
- Ficheros de calibración de control de versiones junto con los episodios grabados.
- Residuos de calibración de registro; rechazar sesiones en las que los residuos superen un umbral previamente acordado.
- Para plataformas bimanual, calibre ambos brazos contra un marco mundial compartido.
- Calibra la posición cero del agarre después de cualquier cambio de dedos.
2. Latencia: el presupuesto que debe establecer antes de comenzar
La latencia de la teleoperación es una variable de primera clase de calidad de datos. Por encima de ~ 150 ms de ida y vuelta, los operadores humanos comienzan a compensar por la desaceleración y la sobresaliente, lo que envenena la distribución de la acción. Por encima de ~ 300 ms, los operadores no pueden realizar tareas ricas en contactos de forma confiable en absoluto. Discutimos el lado de la red en [manipulación de retraso de Internet en la teleoperación]
Lista de control de la latencia
- Medir la latencia de extremo a extremo (entrada del controlador al movimiento del robot) antes de cada sesión.
- Descompone: sensor a red, red a operador, operador a red, red a actuador.
- Establecer y hacer cumplir un presupuesto de latencia a nivel de sesión (recomendamos <80 ms para tareas destresas, <150 ms para mesa).
- Las sesiones de entrega que exceden el presupuesto en lugar de incluirlas en silencio.
- Registran contadores de perf con sello de tiempo junto con los datos de demostración.
3. Limpiación de la acción: el corruptor silencioso
Las acciones de teleoperatoria son ruidosas. Los operadores se ponen nerviosos, los controladores tienen ruido de sensor, el nerviosismo de la red se agrega más. Si entrenas una política sobre acciones ruidosas, aprenderá a imitar el ruido. Si se suaviza demasiado agresivamente, perderás los microajustes de contacto que hacen que las habilidades funcionen.
El filtro de bajo paso que recomendamos es un filtro de bajo paso en la banda de 10-20 Hz en velocidades, aplicado en un tiempo récord en lugar de en el tiempo del tren. Registra tanto la corriente cruda como la suavizada para que los usuarios aguas abajo puedan hacer su propia llamada. Arquitecturas de chunking de acción (ver nuestra [explicante de política ACT](
Lista de control de la acción
- Graba los flujos de acción en bruto y suaves.
- Utilice un filtro consistente en todas las sesiones para un conjunto de datos.
- Registre los parámetros del filtro en los metadatos del conjunto de datos.
- Inspeccionar histogramas de autocorrelación de acción; los picos en la frecuencia de entrada del operador son una señal roja.
- Nunca aplique suavizamiento en el lado de despliegue sin que coincida con el lado de registro (o viceversa).
4. Fronteras de los episodios: el error de etiquetado más común
Se supone que un episodio es un solo intento coherente de una tarea, de inicio a fin, éxito o fracaso. Los equipos de rutina dejan que los episodios sangren juntos
La solución es operativa, no técnica: hacer que las prestaciones de inicio y final del episodio sean físicas (un pedal de pie, un botón grande), requieren una clasificación explícita de "éxito" o "fallo" al final del episodio, y revisar al azar un 5% de los límites del episodio cada semana.
Lista de control de límites de episodios
- Signo físico de inicio/finalización (pedal, botón) con un indicador visible.
- Clasificación obligatoria de éxito/fallo al final del episodio.
- Identificación única por episodio, adjunta al video en bruto para revisión.
- Protocolo de auditoría: revisar el 5% de los límites seleccionados al azar semanalmente.
- Los episodios rechazados o señalados cuya duración no es de la distribución prevista.
5. Etiquetado de recuperación fallido
Los operadores cometen errores y se recuperan. Esas recuperaciones son algunos de los datos más valiosos que se pueden recopilar. enseñan a la política cómo salir de los malos estados. Pero sólo si están etiquetados. Una recuperación sin etiqueta se ve a la política como una demostración extraña de "dejar caer el objeto, luego recoger de nuevo", que imitará obedientemente.
Etiquetar tres estados distintos en cada episodio: progreso nominal, recuperación (el operador corrige un error) y abortar (el episodio se termina temprano). Las políticas entrenadas en este etiquetado pueden estar condicionadas a comportarse de manera diferente en cada régimen, y los evaluadores pueden segmentar las tasas de éxito por cuántas recuperaciones se requieren. El catálogo de errores comunes se encuentra en [errores comunes en el aprendizaje de imitación de robots]
Lista de verificación de la recuperación de fallos
- Definir "recuperación" explícitamente en su manual de operador con ejemplos.
- Exigir a los operadores que den señales de recuperación en vivo (botón o voz) en lugar de en el proceso posterior.
- Rate de recuperación de la pista por operador; operadores de retreno cuya tasa es una anomalía en ambas direcciones.
- Decidir si se mantienen o no las recuperaciones en cada versión del conjunto de datos; documentar la decisión.
6. Interfaz de elección: kinestético vs líder-seguidor vs VR vs guante
La elección de la interfaz moldea sus datos más que casi cualquier otra decisión.
Enseñanza cinestética
El operador mueve el brazo del robot a mano en modo gravitatorio. La mejor calidad de datos para tareas ricas en contacto porque el operador siente el contacto directamente. Bajo rendimiento y mala ergonomía durante sesiones largas.
El líder-seguidor (estilo ALOHA)
El operador mueve un brazo del líder cinemáticamente similar; el seguidor lo refleja. Excelente ergonomía, alto rendimiento, bien adaptado a bimanual. Nuestra guía [ALOHA]
Teléoperación de RV/AR
Operador utiliza un auricular VR y controladores de mano. Excelente para plataformas de largo alcance y móviles; intuitivo para nuevos operadores. Tradeoff: la latencia es más difícil de mantener en el presupuesto, y la fidelidad de seguimiento manual es variable. Ver [comparar compañías de teleoperatoria VR]
Guantes de datos / seguimiento de manos
El movimiento de la mano del operador se capta directamente y se asigna a un agarre o mano hábil. Lo mejor para la manipulación hábil en la mano; más débil para el movimiento del brazo bruto.
Lista de verificación de la interfaz
- Elige la interfaz que coincida con el movimiento dominante de tu tarea (brazo bruto vs destreza en la mano).
- Se adhieren a una interfaz por versión del conjunto de datos; mezclar interfaces introduce el cambio de dominio.
- Registre el tipo de interfaz, la versión del firmware y la calibración en cada episodio.
- Los operadores de tren específicamente para la interfaz elegida; la variación de habilidades del operador domina la elección de la interfaz en el margen.
En [fatiga y ergonomía de la teleoperatoria] ((
7. Higiene del operador
La varianza de operadores es mayor de lo que la mayoría de los investigadores se dan cuenta. Un conjunto de datos recopilado por cinco operadores tiene más varianza dentro de la clase que uno recopilado por un operador durante una línea de tiempo más larga. El punto ideal es generalmente 2-4 operadores por tarea, rotada semanalmente, con capacitación compartida y una sesión de revisión semanal.
- Una especificación escrita de tareas con fotos de estados de éxito y fracaso.
- Un conjunto de "calentamiento" de 10 demostraciones al comienzo de cada sesión, excluidos del conjunto de formación.
- Un video compartido de revisión cada semana que muestra tres demostraciones ejemplares y tres fallidas.
- Metadatos a nivel de operador en cada episodio; seguimiento de la tasa de éxito por operador.
8. Higiene de los datos
La calidad de los datos es una propiedad de la tubería, no una propiedad de la sesión. Los equipos que tienen éxito aquí tratan la tubería como software de producción.
- Inmutable raw. Nunca sobreescriba las grabaciones crudas. Los conjuntos de datos derivados se construyen en el río abajo.
- Versión de todo. Versión del conjunto de datos, versión de calibración, versión de filtro, versión de anotación.
- ** Validación automática.** Cada episodio ingerido recibe una verificación de éxito/fallo en cuanto a duración, rango de acción, caídas de cámara, etc.
- ** Revisar la muestra aleatoria.** Los humanos revisan entre el 1-5% de los episodios cada semana.
- Delición de disciplina. Si decides que un episodio es malo, marca, no lo borras.
Nuestra oferta de [catálogo de conjunto de datos] (
9. Trampas comunes
- Mixing de tipos de interfaz en un conjunto de datos. Mal desplazamiento de dominio, invisible para las curvas de pérdida.
- Drift silencioso del reloj. Sincronizar cámaras y actuadores contra una sola fuente de tiempo monótona.
- Instinto de "más datos es mejor" no preciso. 500 episodios limpios superan a 2000 episodios ruidosos.
- No hay retrasos. Reserva un conjunto de pruebas de operadores / escenas / objetos que tu política nunca ve durante el entrenamiento.
- Incluso en los casos de borde. Los datos de recuperación de fallos y las posiciones de objetos no nominales son las recetas más valiosas.
10. Nota de cierre
Cada hora que se dedica a reforzar la calidad de los datos de la teleoperatoria ahorra aproximadamente diez horas de depuración en aguas subidas. La corrección de aguas subidas es casi siempre más barata que el rescate en aguas subidas. Trata la recopilación de datos como una disciplina de producción, no como una tarea entregada al miembro más reciente del laboratorio.
Si desea un segundo set de ojos en su pipeline, nuestro equipo de [servicios de datos]
Imprima esto. Esta lista de verificación está destinada a vivir en la pared de tu sala de recopilación de datos. ejecuta cada nueva tarea, cada nuevo operador, cada nueva actualización de hardware.
11. Preguntas frecuentes
¿Cuántos episodios necesitamos para una política de trabajo?
Para una tarea de brazo único estrecha y bien definida con datos limpios, los 200-400 episodios suelen ser suficientes para ajustar Octo o OpenVLA a la calidad de la demostración de investigación. Las tareas bimanual suelen necesitar 500-1000 episodios de calidad comparable. Exploramos el lado computacional en [estimular el entrenamiento de VLA en un presupuesto]
¿Deberíamos recopilar datos en el entorno de despliegue o en el laboratorio?
Recopilar la mayoría de los datos en el laboratorio, donde controla la iluminación, calibración y colocación de la cámara. Recopilar un corpus más pequeño y deliberadamente variado en el entorno de despliegue
¿Es la teleoperatoria VR lo suficientemente buena para los datos de producción?
Para las tareas de manipulación bruta y tareas móviles, sí, con atención a la latencia y la calibración del seguimiento manual. Para las tareas de mano hábiles y el montaje rico en contactos, la captura de seguidores de líderes o de guantes sigue siendo la opción de mayor calidad en 2026.
¿Cuánto debe pagar un operador de teleop?
Las tasas de mercado en los Estados Unidos se encuentran en el rango de 25-45 dólares por hora para los operadores no calificados, 50-90 dólares por hora para los operadores hábiles.
¿Podemos usar conjuntos de datos públicos existentes y saltar nuestra propia colección?
Para la preparación, sí







