A3C
Asynchronous Advantage Actor-Critic — un algorithme d'apprentissage par renforcement profond qui entraîne plusieurs instances d'agent en parallèle sur des copies d'environnement séparées, mettant à jour de manière asynchrone un réseau de contrôle partagé. A3C a été l'un des premiers algorithmes à atteindre des performances surhumaines sur les jeux Atari et a démontré que la collecte de données parallèles peut remplacer la relecture d'expérience pour un entraînement stable.







