Ejecución de Política
Una ejecución de política es un único episodio de ejecutar una política entrenada en el robot (o en simulación) desde un estado inicial hasta la finalización de la tarea o tiempo de espera. Las ejecuciones se utilizan para evaluar el desempeño de la política, recopilar nuevos datos para entrenamiento adicional (como en DAgger o ajuste fino de aprendizaje por refuerzo) y depurar modos de fallo. El número de ejecuciones necesarias para una estimación confiable del desempeño depende de la variabilidad de la tarea — tareas de alta varianza pueden requerir 50+ ejecuciones para obtener una estimación estable de la tasa de éxito. En investigación, las ejecuciones se categorizan a menudo por condición inicial (objetos/escenas dentro de distribución vs. fuera de distribución) para caracterizar la generalización. Ver esto en la práctica: nuestras evaluaciones en el mundo real →







