Kontrollrichtlinien-Gradient
Eine Familie von RL-Algorithmen, die die Kontrollrichtlinien-Parameter direkt optimieren, indem der Gradient der erwarteten Rendite in Bezug auf Kontrollrichtlinien-Parameter geschätzt wird. REINFORCE, PPO, TRPO und SAC gehören alle zu dieser Familie. Kontrollrichtlinien-Gradient-Methoden funktionieren mit kontinuierlichen Aktionsräumen (im Gegensatz zu wertbasierten Methoden wie DQN) und sind der Standard-RL-Ansatz für Robotersteuerungsaufgaben.







