SAC
Soft Actor-Critic — 期待リターンと制御則エントロピーの両方を最大化するオフポリシーRL アルゴリズム。探索を促進しながら安定性を維持します。SACはサンプル効率と超パラメータへのロバスト性により、シミュレーション内のロボット操作に人気があります。エントロピー正則化は決定論的制御則への早期収束を防ぎ、環境変動に対するロバスト性を向上させます。
Soft Actor-Critic — 期待リターンと制御則エントロピーの両方を最大化するオフポリシーRL アルゴリズム。探索を促進しながら安定性を維持します。SACはサンプル効率と超パラメータへのロバスト性により、シミュレーション内のロボット操作に人気があります。エントロピー正則化は決定論的制御則への早期収束を防ぎ、環境変動に対するロバスト性を向上させます。