Назад к Glossary

Компромисс между исследованием и использованием

Robot LearningRL

Фундаментальная дилемма в обучении с подкреплением: агент должен балансировать между использованием известных действий с высокой наградой и исследованием неизвестных действий, которые могут дать более высокие награды. Чистое использование приводит к локальным оптимумам; чистое исследование неэффективно. Методы, такие как ε-greedy, UCB, Thompson sampling и любопытство-ориентированное исследование, управляют этим компромиссом. В робототехнике ограничения безопасного исследования делают компромисс более сложным.

Related terms