返回Glossary

Transformer 视觉骨干网络

VisionML

在计算机视觉管道中使用 Vision Transformer (ViT) 作为特征提取骨干网络。与 CNN 骨干网络相比,ViT 骨干网络通过自注意力机制对图像块之间的长距离依赖关系进行建模,在大规模数据集上提供卓越的性能。它们是现代检测(DINO-DETR)、分割(Mask2Former)和 VLA 模型中的默认骨干网络。

Related terms