制御ポリシ(ロボット)
ロボット学習では、制御ポリシ(π で表記)は観測を行動にマッピングする関数です:π(o) → a。制御ポリシはロボットの学習された「脳」であり、各タイムステップで知覚に基づいて何をするかを決定します。制御ポリシはニューラルネットワーク(ニューラル制御ポリシ)、決定木、ガウス過程、またはルックアップテーブルとして表現できます。決定的(観測ごとに1つの行動)または確率的(行動の分布)にすることができます。制御ポリシの品質は、訓練デモンストレーション上だけでなく、多様な条件全体でのタスク成功率によって測定されます。ロボット学習の中核的な課題は、訓練分布を超えて確実に汎化する制御ポリシを訓練することです。 実践例を参照:当社の実世界評価 →







