Glossary(으)로 돌아가기

Vision Transformer

MLVisionTransformer

이미지를 고정 크기 패치로 분할하고, 각 패치를 선형으로 임베딩한 후 위치 인코딩을 추가하여 표준 Transformer 인코더로 처리하는 이미지 분류 아키텍처입니다. ViT는 대규모 데이터셋으로 사전 학습할 때 CNN을 능가하며 지배적인 시각 백본이 되었습니다. ViT 변형(DeiT, Swin, DINOv2)은 현대 VLA 모델의 기본 시각 인코더입니다.

Related terms