Calidad de los datos de demostración de los robots de medición: métricas y umbrales clave
Cómo evaluar la calidad de las demostraciones de teleoperación de robots antes de la formación <unk> índice de éxito, fluidez, cobertura y métricas de diversidad.
[← Investigación]
Metricas de calidad de los datos que predicen el rendimiento de las políticas y los umbrales que debe alcanzar antes de comprometerse con una formación completa.
La calidad sobre la cantidad
La visión más importante de la investigación de imitación a gran escala en los últimos tres años es que la calidad de los datos domina la cantidad de datos para el rendimiento de la política hasta aproximadamente 10.000 demostraciones. Un conjunto de datos seleccionado de 1.000 demostraciones de alta calidad superan constantemente a 5.000 de las ruidosas cuando se entrenan la clonación de comportamiento, ACT o política de difusión.
A pesar de esto, la mayoría de los programas de recopilación de datos no tienen métricas formales de calidad
Taxa de éxito de tareas
La tasa de éxito de tareas es la métrica única más importante. mide qué fracción de demostraciones en su conjunto de datos representan una finalización de tareas realmente exitosa, no solo una movimiento completado.
- Exito binario: El estándar de oro
un revisor humano observa cada episodio y etiqueta que pasa/falle contra una rúbrica escrita. - Rubrica de crédito parcial: Para tareas complejas de múltiples pasos, una etiqueta binaria pierde información. Una rubrica de 5 puntos (0: fracaso completo, 1: tarea iniciada, 2: intermedio clave alcanzado, 3: casi completo, 4: éxito completo) permite la curadoria de conjuntos de datos granulares.
- Clasificadores de éxito automatizados: Para la escala, entrenar un clasificador basado en ResNet-18 o CLIP en un conjunto de semillas etiquetado manualmente de 500
1,000 episodios. Aplicar a todos los episodios restantes. Lleva a una precisión del 85 92% para tareas bien definidas. Siempre validar el rendimiento del clasificador en comparación con un conjunto etiquetado por humanos recién mantenido.
Listo de trayectoria
Las demostraciones suaves entrenan políticas más suaves. Las demostraciones torpes causadas por la inexperiencia del operador, el retraso de la teleoperación o la vinculación mecánica introducen ruido de alta frecuencia que las políticas luchan por aprender y pueden replicar en la implementación.
- Métrica de jerk: La tercera derivada de la posición con respecto al tiempo. Calcule el jerk de RMS sobre cada trayectoria. Las demos de buen operador tienen jerk de RMS < 2 m/s3 para la manipulación de la mesa. Episodios de bandera con jerk de RMS > 5 m/s3 para la revisión humana.
- Varianza de velocidad: Alta variación en la velocidad del efecto final (medida como el coeficiente de variación de
- Limites de velocidad de las articulaciones: Rechazar episodios en los que cualquier articulación exceda el 80% de su velocidad máxima nominal.
Cobertura del espacio de trabajo
Una política que se entrene únicamente en demostraciones que siguen todas el mismo camino fracasará cuando las condiciones iniciales varían ligeramente.
- Volumen de casco convejo del efecto final: Calcule el casco convejo 3D de todas las posiciones del efecto final en todo el conjunto de datos. Comparar con el espacio de trabajo de tareas teóricas.
- Cobreza de la posición del objeto: Si la colocación del objeto se realiza al azar durante la recogida, verifique si la distribución de las posiciones de inicio de los objetos en su conjunto de datos es uniforme en todo el rango previsto.
- ** Distribución de longitud de trayectoria:** Traza el histograma de longitud de trayectoria por episodio (en pasos). La distribución debe ser unimodal y no demasiado amplia (CV < 0,4).
Acción Diversidad
La diversidad de acciones mide si su conjunto de datos contiene una gran variedad de estrategias de manipulación, lo que es importante para las políticas de capacitación que pueden manejar estados inesperados.
- Entropia de acción: Discrete el espacio de acción y computa la entropía de la distribución marginal de acción.
- ** Diversidad por operador:** Calcule una matriz de distancia DTW en forma de pares entre todos los pares de trayectorias del mismo operador frente a diferentes operadores.
- Grasp pose diversidad: Para las tareas de captura, extraer la orientación del agarre en el contacto de la captura para cada demo. trazar la distribución sobre la SO(3) esfera. Un buen conjunto de datos cubre una gama de ángulos de aproximación, no sólo un solo agarre canónico de arriba hacia abajo.
Punto de coherencia humana
Esta métrica mide la reproducción de las demostraciones entre los operadores
- Contrato entre operadores: Calcule la tasa de éxito por separado para cada operador. La variación entre los operadores (σ2 de las tasas de éxito por operador) debe ser baja.
- Similaridad de la norma oro: Compare las demostraciones de cada operador con el conjunto de normas de oro que utiliza DTW en trayectorias conjuntas.
Arquitectura de tuberías de calidad automatizada
En escala, la evaluación de la calidad debe ser automatizada.
- Gate 1
Esquema y validación de sensores: Verifica el esquema HDF5, verifica que los marcos de la cámara no están en blanco, valida el rango de datos de propriocepción. Rechaza ~25% de los episodios por defectos técnicos. - Puerta 2
Filtros cinemáticos: Control de límites conjuntos, control de límites de velocidad, límites de duración. - Puerta 3
Filtro de suavidad: RMS de sacudida y límites de variación de velocidad. Rechaza ~ 515% dependiendo de la experiencia del operador. - Gate 4
Clasificador de éxito: Predicción de éxito basada en ML. Rechaza ~1525% para tareas típicas. Todos los episodios marcados por el clasificador se envían a la cola de revisión humana en lugar de eliminarse automáticamente.
Los umbrales de calidad por algoritmo
| Algorithm | Min. Success Rate | Max. Jerk (RMS) | Min. Demos (typical task) | Sensitivity to Noise |
|---|---|---|---|---|
| Clonación de Comportamiento | >85% | <3 m/s³ | 500–2,000 | High — averages modes |
| ACT (Action Chunking) | >80% | <4 m/s³ | 200–1,000 | Medium — CVAE handles multimodality |
| Diffusion Policy | >70% | <5 m/s³ | 300–1,500 | Low — diffusion models multi-modality |
| IBC (Implicit BC) | >80% | <4 m/s³ | 1,000–5,000 | Medium |
| GAIL / adversarial IL | >75% | <5 m/s³ | 500–3,000 | Low |
Estos umbrales son puntos de partida conservadores. Su tarea específica, plataforma de robots y entorno requerirán calibración empírica. Registre sus métricas de calidad y el rendimiento de la política juntos para que pueda identificar qué métricas son realmente predictivas para su caso de uso.
El RCSV plataforma de datos ejecuta esta línea de calidad automáticamente en todos los episodios ingeridos y proporciona tablas de control por métrica para la revisión de conjuntos de datos.
Datos de demostración garantizados de calidad
Cada conjunto de datos RCSV se envía con un informe de calidad completo







