探索・活用のトレードオフ
強化学習における基本的なジレンマ:エージェントは既知の高報酬行動を活用することと、より高い報酬をもたらす可能性のある未知の行動を探索することのバランスを取る必要がある。純粋な活用は局所最適に陥り、純粋な探索は非効率である。ε-greedy、UCB、Thompson sampling、好奇心駆動探索などの手法がこのトレードオフを管理する。ロボティクスでは、安全な探索制約がこのトレードオフをより困難にする。
強化学習における基本的なジレンマ:エージェントは既知の高報酬行動を活用することと、より高い報酬をもたらす可能性のある未知の行動を探索することのバランスを取る必要がある。純粋な活用は局所最適に陥り、純粋な探索は非効率である。ε-greedy、UCB、Thompson sampling、好奇心駆動探索などの手法がこのトレードオフを管理する。ロボティクスでは、安全な探索制約がこのトレードオフをより困難にする。