RL Online
Aprendizado por reforço onde o agente interage ativamente com o ambiente, coletando novas transições e atualizando sua política em tempo real. RL online pode alcançar desempenho superior ao RL offline explorando regiões não cobertas em conjuntos de dados estáticos, mas requer mecanismos de exploração segura em configurações de robôs físicos. A transferência sim-para-real é frequentemente usada para conduzir com segurança a fase de RL online em simulação.







