Glossary पर वापस जाएं

Q-फ़ंक्शन (कार्य-मूल्य फ़ंक्शन)

Reinforcement LearningValue Function

Q-फ़ंक्शन Q(s, a) अनुमान लगाता है कि एक एजेंट को स्थिति s में कार्य a लेने और फिर दिए गए नीति का पालन करने से प्राप्त होने वाला अपेक्षित संचयी छूट प्राप्त होगी। Q-फ़ंक्शन DQN (असतत कार्य) और SAC, TD3, और DDPG (निरंतर कार्य) जैसे सुदृढ़ीकरण सीखने के एल्गोरिदम के लिए केंद्रीय हैं। रोबोट RL में, लंबी-क्षितिज हेरफेर कार्यों के लिए सटीक Q-फ़ंक्शन सीखना चुनौतीपूर्ण है क्योंकि पुरस्कार विरल हैं और स्थिति-कार्य स्थान उच्च-आयामी है। ऑफलाइन RL (IQL, CQL) में हाल के काम Q-फ़ंक्शन का उपयोग करते हैं ताकि ऑनलाइन इंटरैक्शन के बिना निश्चित डेटासेट से नीतियों को निकाला जा सके, जो अनुकरण सीखने और RL के बीच की खाई को पाटता है। इसे व्यवहार में देखें: हमारे वास्तविक-विश्व मूल्यांकन →

Related terms