Aprendizaje por Imitación Híbrido con RL
Un paradigma de entrenamiento que combina aprendizaje por imitación (de demostraciones) y aprendizaje por refuerzo (de interacción con el entorno) para aprovechar la eficiencia de muestra de las demostraciones mientras permite que RL mejore más allá del desempeño del experto. Los métodos incluyen DAPG (demostraciones como prior para policy gradient), IRL+RL, y Demo-Augmented PPO.







