Vision Transformer
Una arquitectura de clasificación de imágenes que divide las imágenes en parches de tamaño fijo, incrusta linealmente cada parche, añade codificación posicional y procesa la secuencia con un codificador Transformer estándar. Vision Transformer se ha convertido en la columna vertebral visual dominante, superando a las redes convolucionales cuando se preentrenan en conjuntos de datos grandes. Las variantes de ViT (DeiT, Swin, DINOv2) son los codificadores visuales predeterminados en los modelos VLA modernos.







