DDPG
Deep Deterministic Policy Gradient — خوارزمية تعلم معزز خارج السياسة للمساحات الإجراء المستمرة التي تستخدم سياسة حتمية ودالة Q، مدربة عبر نظرية تدرج السياسة الحتمية. تستخدم DDPG إعادة تشغيل التجربة والشبكات المستهدفة للاستقرار. تم تطبيقها على نطاق واسع على مهام التحكم في الروبوت لكنها قد تكون حساسة للمعاملات الفائقة. TD3 (Twin Delayed DDPG) تعالج انحياز الإفراط في التقدير الخاص بها.







