المقايضة بين الاستكشاف والاستغلال
المعضلة الأساسية في التعلم المعزز: يجب على الوكيل أن يوازن بين استغلال الإجراءات المعروفة عالية المكافأة واستكشاف الإجراءات المجهولة التي قد تحقق مكافآت أعلى. يؤدي الاستغلال البحت إلى الوقوع في الحد الأدنى المحلي؛ الاستكشاف البحت غير فعال. تدير طرق مثل ε-greedy و UCB و Thompson sampling والاستكشاف المدفوع بالفضول هذه المقايضة. في الروبوتات، تجعل قيود الاستكشاف الآمن هذه المقايضة أصعب.







