العودة إلى Glossary

عملية قرار ماركوف

MathRL

إطار عمل رياضي لاتخاذ القرارات المتسلسلة تحت عدم اليقين: صيغة (S, A, P, R, γ) تتضمن الحالات والإجراءات واحتمالات الانتقال ودالة المكافأة وعامل الخصم. تتعلم خوارزميات التعلم المعزز سياسات تعظم العائد المخصوم المتوقع في MDP. يتم نمذجة معالجة الروبوتات والحركة كـ MDPs، حيث تربط السياسة الحالات بالإجراءات.

Related terms