Clonage de comportement (BC)
Le clonage de comportement est la forme la plus simple d'apprentissage par imitation : un problème de régression supervisée où la politique est entraînée pour imiter les démonstrations d'experts en minimisant l'erreur de prédiction entre la sortie de la politique et l'action de l'expert à chaque état observé. BC est facile à implémenter et s'adapte bien aux données, mais souffre du décalage distributionnel — parce qu'il ne reçoit jamais de rétroaction corrective, les petites erreurs font que le robot visite des états non présents dans les données d'entraînement, ce qui peut s'aggraver en défaillance de tâche. Des techniques comme DAgger (Dataset Aggregation) et GAIL ont été développées spécifiquement pour résoudre le problème d'erreur cumulative du BC. Voir cela en pratique : notre service de collecte de données →







