Voltar para Glossary

Regularização Comportamental

Robot LearningRL

Uma família de métodos de RL offline que restringem a política aprendida a permanecer próxima à política comportamental que coletou os dados, prevenindo exploração de ações fora da distribuição. Os métodos incluem: restrição de política (TD3+BC), penalidade de divergência KL e restrição de suporte (BEAR). Regularização comportamental é o mecanismo chave que permite RL offline estável.

Related terms