العودة إلى Glossary

تدرج السياسة

Robot LearningRL

عائلة من خوارزميات التعلم المعزز التي تحسّن مباشرة معاملات السياسة بتقدير تدرج العائد المتوقع بالنسبة إلى معاملات السياسة. REINFORCE و PPO و TRPO و SAC تنتمي جميعها إلى هذه العائلة. تعمل طرق تدرج السياسة مع فضاءات الإجراءات المستمرة (بخلاف الطرق القائمة على القيمة مثل DQN) وهي النهج القياسي للتعلم المعزز لمهام التحكم الروبوتي.

Related terms