Evaluación de la política de manipulación de robots: una guía rigurosa de metodología
Cómo evaluar rigurosamente las políticas de manipulación de robots <unk> diseño de los ensayos de prueba, métricas, controles ambientales y importancia estadística.
[← Investigación]
La evaluación rigurosa separa el progreso real del sobreequipamiento de laboratorio.
Por qué es difícil evaluar
La evaluación de las políticas de manipulación es engañosamente difícil. Una política puede lograr un éxito del 95% en los objetos y condiciones de iluminación exactas en que se ha entrenado, pero fracasa por completo cuando una sola variable cambia un fenómeno llamado ** sobreajuste de laboratorio**. La política memoriza el entorno de prueba en lugar de aprender a generalizar.
El problema principal es que los investigadores controlan demasiadas variables durante el entrenamiento y la evaluación. La misma posición de la cámara, la misma altura de la mesa, los mismos objetos en las mismas orientaciones
La evaluación rigurosa requiere de condiciones de mantenimiento intencionadas: objetos nunca vistos durante el entrenamiento, iluminación nunca utilizada durante la recopilación de datos, alturas de mesa deliberadamente diferentes de la configuración del entrenamiento.
Dimensiones de evaluación
Una evaluación completa de la manipulación cubre tres dimensiones primarias:
- ** Taxa de éxito**
tanto binaria (tarea completa / no completa) como parcial crédito. El éxito binario es fácil de calcular pero arroja información. Una política que capta confiablemente correctamente pero cae durante la transferencia merece una puntuación diferente a la que nunca logra una captura estable. Definir rubricas de crédito parciales antes de ejecutar pruebas. - Eficiencia
tiempo para completar la tarea (segundos), número de intervenciones humanas necesarias y número de intentos de re-aprobar. Una política que tiene éxito en 45 segundos supera a la que tiene éxito en 3 minutos para su implementación. Las intervenciones son especialmente importantes: una política que requiere 2 intervenciones por tarea no puede implementarse ni siquiera con un 90% de éxito. - ** Robustez**
variación entre los ensayos (coefficiente de variación), rendimiento en nuevas condiciones (nuevos objetos, nueva iluminación, nuevo desorden) y degradación elegante. Una política con 80% de éxito medio pero 40% de desviación estándar es menos útil que una política con 75% de desviación media y 5% de desviación estándar.
Diseño de los ensayos de prueba
El diseño de los ensayos de prueba es donde la mayoría de los protocolos de evaluación fallan. Un mínimo riguroso para una tarea de selección y ubicación:
3 nuevas condiciones de iluminación × 2 alturas de la mesa × 5 nuevos objetos × 3 configuraciones de distracción = 90 condiciones de ensayo mínimas.
La iluminación novella significa las configuraciones de iluminación que no se utilizan durante ninguna recopilación de datos de entrenamiento
Para cada condición de prueba, ejecuta al menos 5 ensayos para estimar la tasa de éxito por condición. Esto le da 450 ensayos totales para la matriz de 90 condiciones.
Cuadro de métricas
| Metric | Definition | How to Measure | Deployment Threshold |
|---|---|---|---|
| Binary success rate | Task completed without intervention (%) | Human observer scores each trial | ≥ 80% on novel objects |
| Partial credit score | Weighted sub-task completion (0–1) | Rubric-based scoring per phase | ≥ 0.85 mean score |
| Time to completion | Wall-clock seconds from start signal | Automated timer, log per trial | ≤ 2× human baseline |
| Intervention rate | Human resets per 100 trials | Count interventions per session | ≤ 5 per 100 trials |
| Novel object transfer | Success on held-out object set (%) | Separate test set, never in training | ≥ 60% (generalization) |
| Robustness variance | Std dev of success across conditions | Per-condition trial average | CV ≤ 0.20 |
Requisitos estadísticos
Un solo ensayo no prueba nada.
N = 100 ensayos para un intervalo de confianza de ±10 puntos porcentuales en la tasa de éxito (95% de confianza, distribución binomial).
Para la comparación de algoritmos (por ejemplo, "nuestro método vs. ACT base"), utilice un paired t-test en condiciones de prueba coincidentes. ejecuta ambos algoritmos en condiciones idénticas el mismo día, en el mismo entorno. Informar p-valor, tamaño del efecto (d de Cohen), e intervalos de confianza
Para las evaluaciones de múltiples condiciones, utilice un modelo de efectos mixtos con condición como efecto aleatorio. Esto explica la variación sistemática entre las condiciones en lugar de tratar todos los ensayos como independientes.
Control del medio ambiente
Los cambios ambientales pequeños afectan la repetibilidad más de lo que la mayoría de los investigadores asumen:
- Log de posición de la cámara
Marque los puntos de montaje exactos con cinta o soportes fijos. - Lugio de iluminación
registra los niveles de lujo en la superficie del espacio de trabajo antes de cada sesión. La luz natural a través de las ventanas cambia la iluminación en 5000 10000 lujos durante un día. - Log de temperatura
Las superficies de agarre de goma cambian de rigidez con la temperatura. A 18°C vs 28°C, el mismo dedo de agarre produce fuerzas de contacto medibles diferentes. - Protocolo de colocación de objetos
definen zonas de colocación exactas (por ejemplo, "centro de objeto dentro de un radio de 5 cm de objetivo marcado, orientación aleatoria").
Errores comunes en la evaluación
- ** Pruebas en objetos de entrenamiento**
El error más común. Si algún objeto de prueba apareció en los datos de entrenamiento (el mismo SKU, el mismo color), su tasa de éxito mide la memorización. Mantenga un conjunto estricto de objetos retenidos desde el inicio de la recopilación de datos. - ** Condición de iluminación única**
casi todos los resultados de manipulación publicados utilizan una sola configuración de iluminación. - ** Menos de 20 ensayos**
estadísticamente sin sentido. Una política que ha tenido éxito 4/5 veces y una que ha tenido éxito 14/20 veces tienen intervalos de confianza superpuestos. No se puede distinguirlos. - Demonstrativos seleccionados con cerezo
Seleccionar qué ensayos informar o detenerse temprano cuando los resultados parecen buenos. - Vieja de los evaluadores
El investigador que realiza los ensayos sabe cuál es la condición del algoritmo "mejor".
Normas de información
Un informe completo de evaluación de la manipulación incluye: (1) descripción completa del conjunto de ensayos con fotografías de objetos y matriz de condiciones, (2) recuento de ensayos por condición, (3) intervalos de confianza en todas las métricas reportadas, (4) resultados de ensayos estadísticos para comparaciones, (5) condiciones ambientales registradas, (6) vídeo de casos representativos de éxito y fallas, (7) taxonomía de modo de fallo.
Compartir los datos y el código de evaluación. La reproductibilidad en la investigación de manipulación es pobre; proporcionar registros de ensayos y guiones de evaluación en bruto permite a otros construir sobre su trabajo en lugar de volver a implementarlo desde cero.
La plataforma de datos del RCSV proporciona registros de evaluación estructurados, puntuación automática de ensayos y plantillas de informes estandarizadas para el análisis comparativo de políticas de manipulación.
Realizar evaluaciones rigurosas sobre la infraestructura del RCSV
Accede a entornos de evaluación estandarizados, registro automático de ensayos y herramientas de informes estadísticos. Compara su política con las líneas de base publicadas en conjuntos de pruebas compartidos.
[Plataforma de evaluación del acceso]







