Volver a Glossary

Dilema Exploración-Explotación

Robot LearningRL

El dilema fundamental en RL: el agente debe equilibrar la explotación de acciones conocidas de alto recompensa frente a la exploración de acciones desconocidas que podrían generar recompensas mayores. La explotación pura conduce a óptimos locales; la exploración pura es ineficiente. Métodos como ε-greedy, UCB, Thompson sampling y exploración impulsada por curiosidad gestionan este dilema. En robótica, las restricciones de exploración segura hacen el dilema más difícil.

Related terms