Glossaryに戻る

価値関数

Robot LearningRL

与えられた状態(状態価値関数V)または状態行動対(行動価値関数Q)から期待される累積報酬を推定する関数。価値関数は強化学習の中心であり、行動選択とポリシー改善を導く。深層強化学習はニューラルネットワークを使用して価値関数を近似する。ロボット工学では、学習された価値関数は計画のためのコスト・トゥ・ゴー推定値として、また安全性批評家として機能することができる。

Related terms