Explorations-Exploitations-Tradeoff
Das fundamentale Dilemma in RL: Der Agent muss zwischen der Ausnutzung bekannter hochbelohnter Aktionen und der Erkundung unbekannter Aktionen, die höhere Belohnungen bringen könnten, abwägen. Reine Ausnutzung führt zu lokalen Optima; reine Erkundung ist ineffizient. Methoden wie ε-greedy, UCB, Thompson-Sampling und neugiergetriebene Erkundung bewältigen diesen Tradeoff. In der Robotik erschweren sichere Explorationsbeschränkungen den Tradeoff.







