العودة إلى Glossary

المقايضة بين الاستكشاف والاستغلال

Robot LearningRL

المعضلة الأساسية في التعلم المعزز: يجب على الوكيل أن يوازن بين استغلال الإجراءات المعروفة عالية المكافأة واستكشاف الإجراءات المجهولة التي قد تحقق مكافآت أعلى. يؤدي الاستغلال البحت إلى الوقوع في الحد الأدنى المحلي؛ الاستكشاف البحت غير فعال. تدير طرق مثل ε-greedy و UCB و Thompson sampling والاستكشاف المدفوع بالفضول هذه المقايضة. في الروبوتات، تجعل قيود الاستكشاف الآمن هذه المقايضة أصعب.

Related terms