Transformer Visual Backbone
Verwendung eines Vision Transformer (ViT) als Feature-Extraktions-Backbone in einer Computer-Vision-Pipeline. Im Vergleich zu CNN-Backbones modellieren ViT-Backbones Fernabhängigkeiten zwischen Bildpflastern über Self-Attention und bieten überlegene Leistung auf großen Datensätzen. Sie sind der Standard-Backbone in modernen Detection- (DINO-DETR), Segmentierungs- (Mask2Former) und VLA-Modellen.







