A3C
Asynchronous Advantage Actor-Critic — خوارزمية تعلم معزز عميق تدرب عدة نسخ من الوكيل بالتوازي على نسخ منفصلة من البيئة، مع تحديث غير متزامن لشبكة السياسة المشتركة. كانت A3C من أولى الخوارزميات التي حققت أداء خارقة للبشر على ألعاب Atari، وأثبتت أن جمع البيانات بالتوازي يمكن أن يحل محل تخزين التجارب (experience replay) للتدريب المستقر.







