Марковский процесс принятия решений
Математический фреймворк для последовательного принятия решений в условиях неопределённости: кортеж (S, A, P, R, γ) состояний, действий, вероятностей переходов, функции вознаграждения и коэффициента дисконтирования. Алгоритмы обучения с подкреплением изучают управляющие стратегии, максимизирующие ожидаемый дисконтированный доход в MDP. Манипуляция и локомоция робота моделируются как MDP, где управляющая стратегия отображает состояния в действия.







