عملية قرار ماركوف
إطار عمل رياضي لاتخاذ القرارات المتسلسلة تحت عدم اليقين: صيغة (S, A, P, R, γ) تتضمن الحالات والإجراءات واحتمالات الانتقال ودالة المكافأة وعامل الخصم. تتعلم خوارزميات التعلم المعزز سياسات تعظم العائد المخصوم المتوقع في MDP. يتم نمذجة معالجة الروبوتات والحركة كـ MDPs، حيث تربط السياسة الحالات بالإجراءات.







