リプレイバッファ
リプレイバッファ(または経験リプレイメモリ)は、RL エージェントが環境との相互作用中に収集した過去の(状態、アクション、報酬、次の状態、完了)遷移のデータセットです。各訓練ステップで、バッファからランダムなミニバッチをサンプリングして、価値関数または制御ポリシーを訓練し、勾配更新を不安定にする時間的相関を破ります。オフライン RL とロボット学習では、リプレイバッファは人間のデモンストレーションまたは以前に収集されたロールアウトの固定データセットに置き換えられます。優先度付き経験リプレイは、時間差誤差によるサンプリングに重み付けして、訓練を有益な遷移に焦点を当てます。 実際の例を参照してください:当社の実世界評価 →







