עמוד שדרה חזותי Transformer
שימוש ב-Vision Transformer (ViT) כעמוד שדרה חילוץ תכונות בצינור ראייה מחשב. בהשוואה לעמודי שדרה CNN, עמודי שדרה ViT מודלים תלויות טווח ארוך בין תיקיות תמונה דרך self-attention, המספקים ביצועים עליונים בערכות נתונים בקנה מידה גדול. הם עמוד השדרה ברירת המחדל במודלים מודרניים של זיהוי (DINO-DETR), פילוח (Mask2Former) ו-VLA.







