Glossaryに戻る

Transformer視覚バックボーン

VisionML

コンピュータビジョンパイプラインの特徴抽出バックボーンとしてVision Transformer(ViT)を使用します。CNNバックボーンと比較して、ViTバックボーンは自己注意を介して画像パッチ間の長距離依存性をモデル化し、大規模データセットで優れたパフォーマンスを提供します。これらは最新の検出(DINO-DETR)、セグメンテーション(Mask2Former)、およびVLAモデルのデフォルトバックボーンです。

Related terms