Multi-Head-Aufmerksamkeit
Ein Aufmerksamkeitsmechanismus, der mehrere Aufmerksamkeitsoperationen parallel ausführt, jeweils mit unterschiedlichen gelernten Projektionen, und deren Ausgaben verkettet. Multi-Head-Aufmerksamkeit ermöglicht es dem Modell, gleichzeitig auf verschiedene Arten von Informationen (Position, Farbe, Form) zu achten. Sie ist die zentrale Rechenprimitive von Transformer-Architekturen, die in VLAs und Policy-Transformern verwendet werden.







