Voltar para Glossary

Backbone Visual Transformer

VisionML

Usando um Vision Transformer (ViT) como backbone de extração de características em um pipeline de visão computacional. Comparado a backbones CNN, backbones ViT modelam dependências de longo alcance entre patches de imagem via auto-atenção, fornecendo desempenho superior em conjuntos de dados em larga escala. Eles são o backbone padrão em detecção moderna (DINO-DETR), segmentação (Mask2Former) e modelos VLA.

Related terms