Zurück zu Glossary

Explorations-Exploitations-Tradeoff

Robot LearningRL

Das fundamentale Dilemma in RL: Der Agent muss zwischen der Ausnutzung bekannter hochbelohnter Aktionen und der Erkundung unbekannter Aktionen, die höhere Belohnungen bringen könnten, abwägen. Reine Ausnutzung führt zu lokalen Optima; reine Erkundung ist ineffizient. Methoden wie ε-greedy, UCB, Thompson-Sampling und neugiergetriebene Erkundung bewältigen diesen Tradeoff. In der Robotik erschweren sichere Explorationsbeschränkungen den Tradeoff.

Related terms