العودة إلى Glossary

العمود الفقري البصري للـ Transformer

VisionML

استخدام Vision Transformer (ViT) كعمود فقري لاستخراج الميزات في خط أنابيب رؤية الحاسوب. مقارنة بأعمدة CNN الفقرية، تقوم أعمدة ViT الفقرية بنمذجة التبعيات بعيدة المدى بين رقع الصور عبر الانتباه الذاتي، مما يوفر أداءً متفوقاً على مجموعات البيانات الكبيرة. وهي العمود الفقري الافتراضي في الكشف الحديث (DINO-DETR) والتقسيم (Mask2Former) وموديلات VLA.

Related terms