CQL
Conservative Q-Learning — אלגוריתם RL לא מקוון שלומד פונקציית Q שמרנית (פסימית) על ידי הוספת עונש לערכי Q בפעולות מחוץ להתפלגות. זה מונע את בעיית ההערכה יתר שגורמת למדיניות RL לא מקוונות לנצל אזורים בעלי ערך גבוה כוזב שאינם נתמכים בנתונים. CQL היא אחת משיטות RL לא מקוונות הנפוצות ביותר לתמרן רובוטי.







