마르코프 결정 과정
불확실성 하에서 순차적 의사결정을 위한 수학적 프레임워크: 상태, 행동, 전이 확률, 보상 함수, 할인 인자의 튜플(S, A, P, R, γ). 강화학습 알고리즘은 MDP에서 기댓값 할인 수익을 최대화하는 제어 정책을 학습한다. 로봇 조작과 이동은 MDP로 모델링되며, 여기서 제어 정책은 상태를 행동으로 매핑한다.
불확실성 하에서 순차적 의사결정을 위한 수학적 프레임워크: 상태, 행동, 전이 확률, 보상 함수, 할인 인자의 튜플(S, A, P, R, γ). 강화학습 알고리즘은 MDP에서 기댓값 할인 수익을 최대화하는 제어 정책을 학습한다. 로봇 조작과 이동은 MDP로 모델링되며, 여기서 제어 정책은 상태를 행동으로 매핑한다.