Назад к Glossary

Transformer визуальный остов

VisionML

Использование Vision Transformer (ViT) в качестве остова извлечения признаков в конвейере компьютерного зрения. По сравнению с остовами CNN, остовы ViT моделируют дальнодействующие зависимости между патчами изображения через самовнимание, обеспечивая превосходную производительность на крупномасштабных наборах данных. Они являются стандартным остовом в современном обнаружении (DINO-DETR), сегментации (Mask2Former) и моделях VLA.

Related terms