Q-फ़ंक्शन (कार्य-मूल्य फ़ंक्शन)
Q-फ़ंक्शन Q(s, a) अनुमान लगाता है कि एक एजेंट को स्थिति s में कार्य a लेने और फिर दिए गए नीति का पालन करने से प्राप्त होने वाला अपेक्षित संचयी छूट प्राप्त होगी। Q-फ़ंक्शन DQN (असतत कार्य) और SAC, TD3, और DDPG (निरंतर कार्य) जैसे सुदृढ़ीकरण सीखने के एल्गोरिदम के लिए केंद्रीय हैं। रोबोट RL में, लंबी-क्षितिज हेरफेर कार्यों के लिए सटीक Q-फ़ंक्शन सीखना चुनौतीपूर्ण है क्योंकि पुरस्कार विरल हैं और स्थिति-कार्य स्थान उच्च-आयामी है। ऑफलाइन RL (IQL, CQL) में हाल के काम Q-फ़ंक्शन का उपयोग करते हैं ताकि ऑनलाइन इंटरैक्शन के बिना निश्चित डेटासेट से नीतियों को निकाला जा सके, जो अनुकरण सीखने और RL के बीच की खाई को पाटता है। इसे व्यवहार में देखें: हमारे वास्तविक-विश्व मूल्यांकन →







