Retour à Glossary

Vision Transformer

MLVisionTransformer

Une architecture de classification d'images qui divise les images en patchs de taille fixe, intègre linéairement chaque patch, ajoute un codage positionnel et traite la séquence avec un encodeur Transformer standard. ViT est devenu l'épine dorsale visuelle dominante, surpassant les CNN lorsqu'il est pré-entraîné sur de grands ensembles de données. Les variantes de ViT (DeiT, Swin, DINOv2) sont les encodeurs visuels par défaut dans les modèles VLA modernes.

Related terms