DDPG
Deep Deterministic Policy Gradient — алгоритм обучения с подкреплением вне политики для пространств непрерывных действий, который использует детерминированную политику управления и Q-функцию, обучаемые через теорему детерминированного градиента политики. DDPG использует воспроизведение опыта и целевые сети для стабильности. Он широко применялся к задачам управления роботом, но может быть чувствителен к гиперпараметрам. TD3 (Twin Delayed DDPG) решает проблему его переоценки.







