動作のクローン作成(BC)
動作のクローン作成は最も単純な模倣学習の形式です:制御ポリシーが専門家のデモンストレーションを模倣するよう訓練される教師あり回帰問題で、各観測状態における制御ポリシーの出力と専門家の行動の間の予測誤差を最小化します。BC は実装が簡単でデータに対してよくスケールしますが、分布シフトの問題があります。修正フィードバックを受け取らないため、小さなエラーがロボットを訓練データに存在しない状態に導き、タスク失敗へと連鎖する可能性があります。DAgger(Dataset Aggregation)や GAIL などの技術は、BC の誤差累積問題に対処するために特に開発されました。 実践例を見る:データ収集サービス →







