RL en Línea
Aprendizaje por refuerzo donde el agente interactúa activamente con el entorno, recopilando nuevas transiciones y actualizando su política en tiempo real. RL en línea puede lograr un desempeño superior al de RL offline explorando regiones no cubiertas en conjuntos de datos estáticos, pero requiere mecanismos de exploración segura en configuraciones de robots físicos. La transferencia sim-a-real se utiliza frecuentemente para conducir de forma segura la fase de RL en línea en simulación.







