Zurück zu Glossary

Transformer Visual Backbone

VisionML

Verwendung eines Vision Transformer (ViT) als Feature-Extraktions-Backbone in einer Computer-Vision-Pipeline. Im Vergleich zu CNN-Backbones modellieren ViT-Backbones Fernabhängigkeiten zwischen Bildpflastern über Self-Attention und bieten überlegene Leistung auf großen Datensätzen. Sie sind der Standard-Backbone in modernen Detection- (DINO-DETR), Segmentierungs- (Mask2Former) und VLA-Modellen.

Related terms