TD3
Twin Delayed DDPG — ein Off-Policy-RL-Algorithmus, der die Überschätzungsverzerrung von DDPG adressiert durch: (1) Verwendung von zwei Q-Netzwerken und Auswahl des Minimums, (2) Verzögerung von Kontrollpolitik-Updates relativ zu Q-Netzwerk-Updates, und (3) Hinzufügen von geglätteter Ziel-Kontrollpolitik-Rauschen. TD3 ist stabiler als DDPG und ist ein Standard-Baseline für kontinuierliche Kontrollaufgaben beim Roboterlernen.







