Vision Transformer
Uma arquitetura de classificação de imagens que divide imagens em patches de tamanho fixo, incorpora linearmente cada patch, adiciona codificação posicional e processa a sequência com um codificador Transformer padrão. O ViT tornou-se a espinha dorsal visual dominante, superando CNNs quando pré-treinado em grandes conjuntos de dados. Variantes do ViT (DeiT, Swin, DINOv2) são os codificadores visuais padrão em modelos VLA modernos.







