Zurück zu Glossary

Belohnungsmodell

MLRL

Ein neuronales Netzwerk, das trainiert wird, um skalare Belohnungswerte aus Zustand-Aktion-Paaren oder Trajektoriensegmenten vorherzusagen, typischerweise trainiert auf menschlichen Präferenzen oder Experten-Demonstrationen. Belohnungsmodelle ersetzen handwerklich konstruierte Belohnungsfunktionen durch gelernte. Sie sind zentral für RLHF-ähnliches Training und werden in der Robotik verwendet, um komplexe Aufgabenziele zu spezifizieren, die mathematisch schwer zu formalisieren sind.

Related terms