DQN
Deep Q-Network — אלגוריתם RL מבוסס-ערך המשתמש ברשת נוירונית כדי להעריך את פונקציית ה-action-value Q(s,a), בחירת פעולות על ידי מקסימום Q. DQN הציג experience replay ו-target networks לאימון יציב. בעוד שהוא משמש בעיקר למרחבי פעולה בדידים (משחקי Atari), וריאנטים של DQN הותאמו לבקרת רובוט בדידה.







