Autoencodeur masqué
Une approche d'apprentissage auto-supervisé où des patches aléatoires d'une image sont masqués, et un encodeur-décodeur ViT apprend à reconstruire les patches manquants. L'apprentissage préalable MAE apprend des représentations visuelles fortes qui se transfèrent bien aux tâches en aval. En robotique, les encodeurs visuels pré-entraînés MAE fournissent des caractéristiques robustes pour les politiques de manipulation, en particulier avec des données robotiques étiquetées limitées.







