Zurück zu Glossary

Markov-Entscheidungsprozess

MathRL

Ein mathematisches Rahmenwerk für sequenzielle Entscheidungsfindung unter Unsicherheit: ein Tupel (S, A, P, R, γ) aus Zuständen, Aktionen, Übergangwahrscheinlichkeiten, Belohnungsfunktion und Diskontfaktor. RL-Algorithmen lernen Kontrollrichtlinien, die die erwartete diskontierte Rendite in einem MDP maximieren. Robotermanipulation und Fortbewegung werden als MDPs modelliert, wobei die Kontrollrichtlinie Zustände auf Aktionen abbildet.

Related terms