Glossaryに戻る

選好学習

Robot LearningRL

明示的な報酬信号またはデモンストレーションではなく、人間の比較判断(例:「軌跡Aは軌跡Bより優れている」)から学習します。報酬モデルは人間の選好と一貫性を持つように訓練され、その後RLを介して制御ポリシーを最適化するために使用されます。このアプローチ(ロボティクスに適用されたRLHF)は、正確なスカラー報酬エンジニアリングの必要性を回避し、微妙な人間の意図をキャプチャできます。

Related terms