Vision Transformer
一种图像分类架构,将图像分割成固定大小的补丁,对每个补丁进行线性嵌入,添加位置编码,并用标准 Transformer 编码器处理序列。ViT 已成为主导的视觉骨干网络,在大规模数据集上预训练时超越了 CNN。ViT 变体(DeiT、Swin、DINOv2)是现代 VLA 模型中的默认视觉编码器。
一种图像分类架构,将图像分割成固定大小的补丁,对每个补丁进行线性嵌入,添加位置编码,并用标准 Transformer 编码器处理序列。ViT 已成为主导的视觉骨干网络,在大规模数据集上预训练时超越了 CNN。ViT 变体(DeiT、Swin、DINOv2)是现代 VLA 模型中的默认视觉编码器。