Cómo evaluar las políticas de robots en el mundo real
Un marco práctico para la evaluación de las políticas de robots en el mundo real: métricas, recuentos de episodios, variación ambiental y importancia estadística.
Por qué las métricas de Sim no son suficientes
Las tasas de éxito de la simulación a menudo no se transfieren al rendimiento del mundo real. Los cambios de iluminación, las variaciones de objetos, la deriva de calibración y el ruido de los sensores afectan al rendimiento real. Un protocolo de evaluación riguroso del mundo real es esencial para los resultados publicables y las decisiones de implementación.
El Protocolo de evaluación
Realice un mínimo de 50 ensayos por condición (100 preferidos para intervalos de confianza apretados). Varias instancias de objetos, posiciones, condiciones de iluminación y operador. Informar la tasa de éxito con intervalos de confianza del 95% utilizando la puntuación Wilson. Grabar y revisar todos los episodios de falla. Documente las condiciones del entorno para la reproducibilidad.
- 50 ensayos por condición
- Al menos 3 variaciones de objetos
- 2+ condiciones de iluminación
- Intervalos de confianza de Wilson
- Grabación de vídeo de todas las pruebas
Encabezos comunes
Seleccionar configuraciones de inicio fáciles, no informar los modos de falla, usar la misma instancia de objeto para todos los ensayos y ejecutar evaluaciones inmediatamente después de la sintonización (sobreajuste a las condiciones actuales).
Por qué las métricas de Sim no son suficientes
Las tasas de éxito de la simulación a menudo no se transfieren al rendimiento del mundo real. Los cambios de iluminación, las variaciones de objetos, la deriva de calibración y el ruido de los sensores afectan al rendimiento real. Un protocolo de evaluación riguroso del mundo real es esencial para los resultados publicables y las decisiones de implementación.
El Protocolo de evaluación
Realice un mínimo de 50 ensayos por condición (100 preferidos para intervalos de confianza apretados). Varias instancias de objetos, posiciones, condiciones de iluminación y operador. Informar la tasa de éxito con intervalos de confianza del 95% utilizando la puntuación Wilson. Grabar y revisar todos los episodios de falla. Documente las condiciones del entorno para la reproducibilidad.
- 50 ensayos por condición
- Al menos 3 variaciones de objetos
- 2+ condiciones de iluminación
- Intervalos de confianza de Wilson
- Grabación de vídeo de todas las pruebas
Encabezos comunes
Seleccionar configuraciones de inicio fáciles, no informar los modos de falla, usar la misma instancia de objeto para todos los ensayos y ejecutar evaluaciones inmediatamente después de la sintonización (sobreajuste a las condiciones actuales).







