Vision Transformer
Архитектура классификации изображений, которая разбивает изображения на фиксированные патчи, линейно встраивает каждый патч, добавляет позиционное кодирование и обрабатывает последовательность стандартным трансформер-энкодером. Vision Transformer стал доминирующей визуальной основой, превзойдя CNN при предварительном обучении на больших датасетах. Варианты ViT (DeiT, Swin, DINOv2) являются стандартными визуальными энкодерами в современных VLA моделях.







