報酬関数
報酬関数は強化学習エージェントの学習目的を定義します。各(状態、行動、次状態)遷移にスカラー報酬信号r(s, a, s')を割り当て、エージェントの行動がどの程度良いか悪いかを伝えます。報酬関数の設計はRLをロボット工学に適用する際の最も難しい部分の1つです。疎な報酬(成功時に1、それ以外は0)はシンプルですが学習が遅くなります。密な報酬(例:目標までの負の距離)は学習を導きますが、予期しない方法でゲーム化される可能性があります(報酬ハッキング)。代替案には、デモンストレーションからの報酬学習(IRL、RLHF)、タスク固有のシミュレーションメトリクス、および学習された選好モデルが含まれます。模倣学習はデモンストレーションから直接学習することで報酬設計の問題を完全に回避します。 実践例を参照:実世界評価 →







