Belohnungs-Engineering
Der Prozess der Gestaltung einer skalaren Belohnungsfunktion, die das gewünschte Roboterverhalten für RL-Training kodiert. Gutes Belohnungs-Engineering bietet dichtes Feedback, das das Lernen lenkt, ohne unbeabsichtigte Abkürzungen einzuführen. Häufige Fallstricke: Reward Hacking (Optimierung des Belohnungs-Proxys statt des beabsichtigten Verhaltens) und spärliche Belohnungen (Lernsignal zu selten).







