Retour à Glossary

Backbone Transformer visuel

VisionML

Utilisation d'un Vision Transformer (ViT) comme backbone d'extraction de caractéristiques dans un pipeline de vision par ordinateur. Comparés aux backbones CNN, les backbones ViT modélisent les dépendances à longue portée entre les patchs d'image via l'auto-attention, offrant des performances supérieures sur les ensembles de données à grande échelle. Ils sont le backbone par défaut dans la détection moderne (DINO-DETR), la segmentation (Mask2Former) et les modèles VLA.

Related terms