RL com Restrições de Segurança
Aprendizado por reforço restrito que otimiza retorno enquanto satisfaz restrições de segurança (ex: probabilidade de colisão < 0,01, limites de torque articular). Otimização de política restrita (CPO), métodos Lagrangianos e funções de barreira de controle são abordagens comuns. RL seguro é crítico para implantação de robô no mundo real onde violações de restrição podem danificar hardware ou prejudicar pessoas.







