A3C
Asynchronous Advantage Actor-Critic — ein Deep-RL-Algorithmus, der mehrere Agent-Instanzen parallel auf separaten Umgebungskopien trainiert und asynchron ein gemeinsames Kontrollnetzwerk aktualisiert. A3C war einer der ersten Algorithmen, die übermenschliche Leistung bei Atari-Spielen erreichten, und zeigte, dass parallele Datenerfassung Experience Replay für stabiles Training ersetzen kann.







