חזרה לGlossary

פונקציית Q (פונקציית ערך-פעולה)

Reinforcement LearningValue Function

פונקציית Q Q(s, a) מעריכה את התגמול המצטבר המהוון הצפוי שסוכן יקבל על ידי ביצוע פעולה a במצב s ולאחר מכן ביצוע מדיניות נתונה. פונקציות Q הן מרכזיות לאלגוריתמים של reinforcement learning כגון DQN (פעולות בדידות) ו-SAC, TD3 ו-DDPG (פעולות רציפות). ב-RL של רובוטים, למידת פונקציות Q מדויקות למשימות מניפולציה בעלות אופק ארוך היא קשה מכיוון שתגמולים דלים ומרחב המצב-פעולה הוא בעל ממד גבוה. עבודה אחרונה ב-offline RL (IQL, CQL) משתמשת בפונקציות Q כדי לחלץ מדיניות ממערכי נתונים קבועים ללא אינטראקציה מקוונת, גשר בין למידת חיקוי ל-RL. ראה זאת בפועל: ההערכות שלנו בעולם האמיתי →

Related terms