תהליך החלטה של מרקוב
מסגרת מתמטית לקבלת החלטות רציפות בתנאי אי-ודאות: tuple (S, A, P, R, γ) של מצבים, פעולות, הסתברויות מעבר, פונקציית תגמול וגורם הנחה. אלגוריתמים של RL לומדים מדיניות שממקסמות תשואה מהוונת צפויה ב-MDP. מניפולציה ותנועה של רובוטים מעוצבות כ-MDPs, כאשר המדיניות ממפה מצבים לפעולות.







