Vision Transformer
画像を固定サイズのパッチに分割し、各パッチを線形埋め込みし、位置エンコーディングを追加し、標準的なTransformerエンコーダーで処理する画像分類アーキテクチャ。ViTは大規模データセットで事前学習されるとCNNを上回り、支配的な視覚バックボーンとなっています。ViT変種(DeiT、Swin、DINOv2)は現代的なVLAモデルのデフォルト視覚エンコーダーです。
画像を固定サイズのパッチに分割し、各パッチを線形埋め込みし、位置エンコーディングを追加し、標準的なTransformerエンコーダーで処理する画像分類アーキテクチャ。ViTは大規模データセットで事前学習されるとCNNを上回り、支配的な視覚バックボーンとなっています。ViT変種(DeiT、Swin、DINOv2)は現代的なVLAモデルのデフォルト視覚エンコーダーです。