Glossary(으)로 돌아가기

탐색-활용 트레이드오프

Robot LearningRL

강화학습의 근본적인 딜레마: 에이전트는 알려진 고보상 행동을 활용하는 것과 더 높은 보상을 얻을 수 있는 미지의 행동을 탐색하는 것 사이의 균형을 맞춰야 합니다. 순수 활용은 국소 최적값으로 이어지고, 순수 탐색은 비효율적입니다. ε-greedy, UCB, Thompson sampling, 호기심 기반 탐색 같은 방법들이 이 트레이드오프를 관리합니다. 로봇공학에서는 안전한 탐색 제약이 이 트레이드오프를 더 어렵게 만듭니다.

Related terms