Offline-RL
Verstärkungslernen aus einem festen Datensatz von zuvor gesammelten Übergängen, ohne zusätzliche Online-Interaktion mit der Umgebung. Offline-RL-Algorithmen (CQL, IQL, TD3+BC) adressieren die Verteilungsverschiebung zwischen der Kontrollpolitik, die die Daten gesammelt hat, und der gelernten Politik. Offline-RL ist für die Robotik attraktiv, da es die Sicherheitsbedenken und Kosten der Online-Exploration vermeidet.







