Politique (robot)
En apprentissage robotique, une politique (notée π) est une fonction qui mappe les observations aux actions : π(o) → a. La politique est le « cerveau » appris du robot qui détermine quoi faire à chaque pas de temps en fonction de ce qu'il perçoit. Les politiques peuvent être représentées comme des réseaux de neurones (politiques neurales), des arbres de décision, des processus gaussiens ou des tables de consultation. Elles peuvent être déterministes (une action par observation) ou stochastiques (une distribution sur les actions). La qualité de la politique est mesurée par le taux de succès de la tâche dans des conditions diverses, pas seulement sur les démonstrations d'entraînement. Le défi central de l'apprentissage robotique est d'entraîner des politiques qui se généralisent de manière fiable au-delà de leur distribution d'entraînement. Voir cela en pratique : nos évaluations en monde réel →







