Zurück zu Glossary

Q-Funktion (Aktions-Wert-Funktion)

Reinforcement LearningValue Function

Die Q-Funktion Q(s, a) schätzt die erwartete kumulative diskontierte Belohnung, die ein Agent erhält, indem er Aktion a im Zustand s ausführt und dann einer gegebenen Kontrollpolitik folgt. Q-Funktionen sind zentral für Reinforcement-Learning-Algorithmen wie DQN (diskrete Aktionen) und SAC, TD3 und DDPG (kontinuierliche Aktionen). In der Robotik-RL ist das Erlernen genauer Q-Funktionen für langfristige Manipulationsaufgaben herausfordernd, da Belohnungen spärlich sind und der Zustands-Aktions-Raum hochdimensional ist. Neuere Arbeiten in Offline-RL (IQL, CQL) verwenden Q-Funktionen, um Kontrollpolitiken aus festen Datensätzen ohne Online-Interaktion zu extrahieren und überbrücken die Lücke zwischen Imitationslernen und RL. Siehe dies in der Praxis: unsere realen Evaluierungen →

Related terms