חזרה לGlossary

DDPG

RL

Deep Deterministic Policy Gradient — אלגוריתם RL מחוץ-למדיניות למרחבי פעולה רציפים המשתמש במדיניות דטרמיניסטית ופונקציית Q, מאומנים דרך משפט שיפוע המדיניות הדטרמיניסטי. DDPG משתמש בחזרה על ניסיון ורשתות יעד ליציבות. הוא יושם בהרחבה לתפקידי בקרת רובוט אך יכול להיות רגיש לפרמטרים. TD3 (Twin Delayed DDPG) מטפל בהטיית ההערכה הגבוהה שלו.

Related terms