अन्वेषण-शोषण व्यापार-बंद
RL में मौलिक दुविधा: एजेंट को ज्ञात उच्च-पुरस्कार क्रियाओं का शोषण करने बनाम अज्ञात क्रियाओं की खोज करने के बीच संतुलन बनाना चाहिए जो उच्च पुरस्कार दे सकती हैं। शुद्ध शोषण स्थानीय इष्टतम की ओर ले जाता है; शुद्ध अन्वेषण अक्षम है। ε-greedy, UCB, Thompson sampling, और जिज्ञासा-संचालित अन्वेषण जैसी विधियाँ इस व्यापार-बंद को प्रबंधित करती हैं। रोबोटिक्स में, सुरक्षित अन्वेषण बाधाएँ इस व्यापार-बंद को कठिन बनाती हैं।







