Autocodificador Enmascarado
Un enfoque de preentrenamiento autosupervisado donde parches aleatorios de una imagen se enmascaran, y un codificador-decodificador ViT aprende a reconstruir los parches faltantes. El preentrenamiento MAE aprende representaciones visuales sólidas que se transfieren bien a tareas posteriores. En robótica, los codificadores de visión preentrenados con MAE proporcionan características robustas para políticas de manipulación, especialmente con datos robóticos etiquetados limitados.







