DQN
Deep Q-Network — एक मान-आधारित RL एल्गोरिथ्म जो क्रिया-मान फ़ंक्शन Q(s,a) को अनुमानित करने के लिए एक तंत्रिका नेटवर्क का उपयोग करता है, Q को अधिकतम करके क्रियाओं का चयन करता है। DQN ने स्थिर प्रशिक्षण के लिए अनुभव पुनरावृत्ति और लक्ष्य नेटवर्क पेश किए। जबकि मुख्य रूप से असतत क्रिया स्थानों (Atari गेम) के लिए उपयोग किया जाता है, DQN वेरिएंट को विवेकीकृत रोबोट नियंत्रण के लिए अनुकूलित किया गया है।







