Glossary पर वापस जाएं

अन्वेषण-शोषण व्यापार-बंद

Robot LearningRL

RL में मौलिक दुविधा: एजेंट को ज्ञात उच्च-पुरस्कार क्रियाओं का शोषण करने बनाम अज्ञात क्रियाओं की खोज करने के बीच संतुलन बनाना चाहिए जो उच्च पुरस्कार दे सकती हैं। शुद्ध शोषण स्थानीय इष्टतम की ओर ले जाता है; शुद्ध अन्वेषण अक्षम है। ε-greedy, UCB, Thompson sampling, और जिज्ञासा-संचालित अन्वेषण जैसी विधियाँ इस व्यापार-बंद को प्रबंधित करती हैं। रोबोटिक्स में, सुरक्षित अन्वेषण बाधाएँ इस व्यापार-बंद को कठिन बनाती हैं।

Related terms