Q関数(行動価値関数)
Q関数 Q(s, a) は、エージェントが状態 s で行動 a を取り、その後与えられた方針に従うことで受け取る期待累積割引報酬を推定する。Q関数は DQN(離散行動)および SAC、TD3、DDPG(連続行動)などの強化学習アルゴリズムの中心である。ロボット強化学習では、長期間の操作タスクに対して正確なQ関数を学習することは困難である。なぜなら報酬が疎であり、状態行動空間が高次元だからである。オフライン強化学習(IQL、CQL)の最近の研究は、Q関数を使用してオンライン相互作用なしに固定データセットからポリシーを抽出し、模倣学習と強化学習の間のギャップを埋めている。 実践例を見る:当社の実世界評価 →







