Attention multi-têtes
Un mécanisme d'attention qui exécute plusieurs opérations d'attention en parallèle, chacune avec des projections apprises différentes, puis concatène leurs sorties. L'attention multi-têtes permet au modèle de traiter simultanément différents types d'informations (position, couleur, forme). C'est la primitive de calcul fondamentale des architectures Transformer utilisées dans les VLA et les policy transformers.







