CLIP
Contrastive Language-Image Pre-training — un modèle entraîné par OpenAI sur 400M paires image-texte pour apprendre des représentations visuelles et linguistiques alignées. Les embeddings CLIP sont utilisés en robotique pour la détection d'objets en vocabulaire ouvert, la manipulation conditionnée par le langage et la spécification de récompenses. Les modèles VLA comme RT-2 et SayCan exploitent l'alignement vision-langage de style CLIP pour ancrer les commandes linguistiques dans les actions robotiques.







