تدرج السياسة
عائلة من خوارزميات التعلم المعزز التي تحسّن مباشرة معاملات السياسة بتقدير تدرج العائد المتوقع بالنسبة إلى معاملات السياسة. REINFORCE و PPO و TRPO و SAC تنتمي جميعها إلى هذه العائلة. تعمل طرق تدرج السياسة مع فضاءات الإجراءات المستمرة (بخلاف الطرق القائمة على القيمة مثل DQN) وهي النهج القياسي للتعلم المعزز لمهام التحكم الروبوتي.







