TD3
Twin Delayed DDPG — خوارزمية تعلم معزز خارج السياسة تعالج انحياز الإفراط في التقدير في DDPG من خلال: (1) استخدام شبكتي Q وأخذ الحد الأدنى، (2) تأخير تحديثات السياسة بالنسبة إلى تحديثات شبكة Q، و(3) إضافة ضوضاء سياسة هدف ممسحة. TD3 أكثر استقراراً من DDPG وهي خط أساس قياسي لمهام التعلم الروبوتي للتحكم المستمر.







