Exécution de politique
Une exécution de politique est un seul épisode d'exécution d'une politique entraînée sur le robot (ou en simulation) à partir d'un état initial jusqu'à l'accomplissement de la tâche ou l'expiration du délai. Les exécutions sont utilisées pour évaluer les performances de la politique, collecter de nouvelles données pour un entraînement ultérieur (comme dans DAgger ou l'affinage RL) et déboguer les modes de défaillance. Le nombre d'exécutions nécessaires pour une estimation fiable des performances dépend de la variabilité de la tâche — les tâches à haute variance peuvent nécessiter 50+ exécutions pour obtenir une estimation stable du taux de succès. En recherche, les exécutions sont souvent catégorisées par condition initiale (objets/scènes en distribution vs. hors distribution) pour caractériser la généralisation. Voir cela en pratique : nos évaluations en monde réel →







