TD3
Twin Delayed DDPG — алгоритм обучения с подкреплением вне политики, который устраняет смещение переоценки DDPG путем: (1) использования двух Q-сетей и выбора минимума, (2) задержки обновлений политики относительно обновлений Q-сетей и (3) добавления сглаженного шума целевой политики. TD3 более стабилен, чем DDPG, и является стандартным базовым методом для задач обучения роботов с непрерывным управлением.







