Zurück zu Glossary

Stochastische Kontrollpolitik

Robot LearningRLPolicy

Eine Kontrollpolitik, die eine Wahrscheinlichkeitsverteilung über Aktionen ausgibt (anstelle einer einzelnen deterministischen Aktion), was Exploration und Umgang mit aleatorischer Unsicherheit ermöglicht. Gaußsche Kontrollpolitiken (Mittelwert + diagonale Kovarianz) sind Standard in Policy-Gradient-RL. Diffusion Policy und Normalizing-Flow-Kontrollpolitiken erweitern auf komplexere Aktionsverteilungen. Stochastische Kontrollpolitiken sind notwendig für Maximum-Entropy-RL (SAC).

Related terms