Dilemme exploration-exploitation
Le dilemme fondamental en apprentissage par renforcement : l'agent doit équilibrer l'exploitation des actions à haut rendement connues par rapport à l'exploration d'actions inconnues qui pourraient donner des rendements plus élevés. L'exploitation pure conduit à des optima locaux ; l'exploration pure est inefficace. Des méthodes comme ε-greedy, UCB, Thompson sampling et l'exploration guidée par la curiosité gèrent ce dilemme. En robotique, les contraintes d'exploration sûre rendent le dilemme plus difficile.







