Назад к Glossary

RL с ограничениями безопасности

Robot LearningRLSafety

Обучение с подкреплением с ограничениями, которое оптимизирует доход при соблюдении ограничений безопасности (например, вероятность столкновения < 0,01, пределы крутящего момента сустава). Оптимизация политики управления с ограничениями (CPO), методы Лагранжа и функции барьера управления — распространённые подходы. RL безопасности критичен для развёртывания робота в реальном мире, где нарушение ограничений может повредить оборудование или причинить вред людям.

Related terms