Hybrid-Imitationslernen RL
Ein Trainingsparadigma, das Imitationslernen (aus Demonstrationen) und Verstärkungslernen (aus Umgebungsinteraktion) kombiniert, um die Stichprobeneffizienz von Demonstrationen zu nutzen und gleichzeitig RL die Verbesserung über die Leistung des Experten hinaus zu ermöglichen. Methoden umfassen DAPG (Demonstrationen als Prior für Policy Gradient), IRL+RL und Demo-Augmented PPO.







