שיפוע מדיניות
משפחה של אלגוריתמי RL המייעלים ישירות את פרמטרי המדיניות על ידי הערכת שיפוע התשואה הצפויה ביחס לפרמטרי המדיניות. REINFORCE, PPO, TRPO, ו-SAC כולם שייכים למשפחה זו. שיטות שיפוע מדיניות עובדות עם מרחבי פעולה רציפים (בניגוד לשיטות מבוססות ערך כמו DQN) והן הגישה הסטנדרטית של RL לתפקידי בקרת רובוט.







