Glossaryに戻る

制御ポリシロールアウト

EvaluationPolicy

制御ポリシロールアウトは、訓練された制御ポリシをロボット(またはシミュレーション)上で初期状態からタスク完了またはタイムアウトまで実行する単一エピソードです。ロールアウトは制御ポリシのパフォーマンス評価、さらなる訓練のための新しいデータ収集(DAggerやRL微調整のように)、および失敗モードのデバッグに使用されます。信頼性の高いパフォーマンス推定に必要なロールアウト数はタスク変動性に依存します。高分散タスクでは安定した成功率推定を得るために50以上のロールアウトが必要な場合があります。研究では、ロールアウトはしばしば初期条件(分布内 vs. 分布外のオブジェクト/シーン)によって分類され、汎化を特性化します。 実践例を参照:当社の実世界評価 →

Related terms