CQL
Conservative Q-Learning — ein Offline-RL-Algorithmus, der eine konservative (pessimistische) Q-Funktion durch Hinzufügen einer Strafe für Q-Werte bei außerhalb der Verteilung liegenden Aktionen erlernt. Dies verhindert das Überschätzungsproblem, das dazu führt, dass Offline-RL-Kontrollrichtlinien spurlose hochwertige Regionen ausnutzen, die nicht durch die Daten gestützt werden. CQL ist eine der am weitesten verbreiteten Offline-RL-Methoden für Robotermanipulation.







