Dilema Exploração-Exploração
O dilema fundamental em RL: o agente deve equilibrar explorar ações de alta recompensa conhecidas versus explorar ações desconhecidas que podem gerar recompensas maiores. Exploração pura leva a ótimos locais; exploração pura é ineficiente. Métodos como ε-greedy, UCB, Thompson sampling e exploração orientada por curiosidade gerenciam esse dilema. Em robótica, restrições de exploração segura tornam o dilema mais difícil.







