Backbone Transformer visuel
Utilisation d'un Vision Transformer (ViT) comme backbone d'extraction de caractéristiques dans un pipeline de vision par ordinateur. Comparés aux backbones CNN, les backbones ViT modélisent les dépendances à longue portée entre les patchs d'image via l'auto-attention, offrant des performances supérieures sur les ensembles de données à grande échelle. Ils sont le backbone par défaut dans la détection moderne (DINO-DETR), la segmentation (Mask2Former) et les modèles VLA.







