חזרה לGlossary

TRPO

RL

Trust Region Policy Optimization — אלגוריתם RL של policy gradient המגביל כל עדכון control policy לאזור אמון (נמדד על ידי KL divergence) כדי למנוע עדכונים גדולים והרסניים. TRPO מספק ערבויות שיפור מונוטוני אך יקר מבחינה חישובית בגלל האופטימיזציה המוגבלת. PPO משוער את היתרונות של TRPO עם objective surrogate מחוצץ פשוט יותר.

Related terms