Transformer 시각적 백본
컴퓨터 비전 파이프라인에서 Vision Transformer(ViT)를 특징 추출 백본으로 사용합니다. CNN 백본과 비교하여 ViT 백본은 자기 주의를 통해 이미지 패치 간의 장거리 의존성을 모델링하여 대규모 데이셋에서 우수한 성능을 제공합니다. 이들은 현대의 탐지(DINO-DETR), 분할(Mask2Former) 및 VLA 모델의 기본 백본입니다.
컴퓨터 비전 파이프라인에서 Vision Transformer(ViT)를 특징 추출 백본으로 사용합니다. CNN 백본과 비교하여 ViT 백본은 자기 주의를 통해 이미지 패치 간의 장거리 의존성을 모델링하여 대규모 데이셋에서 우수한 성능을 제공합니다. 이들은 현대의 탐지(DINO-DETR), 분할(Mask2Former) 및 VLA 모델의 기본 백본입니다.