Zurück zu Glossary

Vision Transformer

MLVisionTransformer

Eine Bildklassifizierungsarchitektur, die Bilder in Patches fester Größe aufteilt, jeden Patch linear einbettet, Positionskodierung hinzufügt und die Sequenz mit einem Standard-Transformer-Encoder verarbeitet. ViT ist zum dominanten visuellen Backbone geworden und übertrifft CNNs, wenn es auf großen Datensätzen vortrainiert wird. ViT-Varianten (DeiT, Swin, DINOv2) sind die Standard-Visualkodierer in modernen VLA-Modellen.

Related terms