Columna Vertebral Visual Transformer
Uso de un Vision Transformer (ViT) como columna vertebral de extracción de características en una tubería de visión por computadora. Comparado con columnas vertebrales CNN, las columnas vertebrales ViT modelan dependencias de largo alcance entre parches de imagen mediante auto-atención, proporcionando rendimiento superior en conjuntos de datos a gran escala. Son la columna vertebral predeterminada en detección moderna (DINO-DETR), segmentación (Mask2Former) y modelos VLA.







