CLIP
Contrastive Language-Image Pre-training — ein von OpenAI auf 400M Bild-Text-Paaren trainiertes Modell zum Erlernen ausgerichteter visueller und sprachlicher Repräsentationen. CLIP-Einbettungen werden in der Robotik für offenes Vokabular-Objekterkennung, sprachgesteuerte Manipulation und Reward-Spezifikation verwendet. VLA-Modelle wie RT-2 und SayCan nutzen CLIP-ähnliche Vision-Language-Ausrichtung, um Sprachbefehle in Roboterhandlungen zu verankern.







