RL Offline-para-Online
Um paradigma de treinamento que inicializa uma política offline a partir de um conjunto de dados estático, depois a ajusta online com interação adicional com o ambiente. A fase offline fornece uma boa inicialização que evita exploração inicial insegura; a fase online melhora além do desempenho dos dados offline. IQL e CQL são fases offline comuns para manipulação robótica.







