Zurück zu Glossary

DDPG

RL

Deep Deterministic Policy Gradient — ein Off-Policy-RL-Algorithmus für kontinuierliche Aktionsräume, der eine deterministische Kontrollpolitik und eine Q-Funktion verwendet, trainiert über das deterministische Policy-Gradient-Theorem. DDPG nutzt Experience Replay und Ziel-Netzwerke für Stabilität. Es wurde weit verbreitet auf Robotersteuerungsaufgaben angewendet, kann aber empfindlich gegenüber Hyperparametern sein. TD3 (Twin Delayed DDPG) adressiert seine Überschätzungsverzerrung.

Related terms