DQN
Deep Q-Network — خوارزمية RL قائمة على القيمة تستخدم شبكة عصبية لتقريب دالة القيمة-الإجراء Q(s,a)، واختيار الإجراءات بتعظيم Q. قدمت DQN إعادة تشغيل التجربة والشبكات المستهدفة للتدريب المستقر. بينما تُستخدم بشكل أساسي لمساحات الإجراءات المنفصلة (ألعاب Atari)، تم تكييف متغيرات DQN للتحكم في الروبوت المنفصل.







