חזרה לGlossary

CLIP

Robot LearningVision-Language

Contrastive Language-Image Pre-training — מודל שאומן על ידי OpenAI על 400M זוגות תמונה-טקסט כדי ללמוד ייצוגים חזותיים ולשוניים מיושרים. הטמעות CLIP משמשות בروביטיקה לגילוי אובייקטים בעל אוצר מילים פתוח, תמרון מותנה בשפה וציון תגמול. מודלי VLA כמו RT-2 ו-SayCan מנצלים יישור חזון-שפה בסגנון CLIP כדי לעגן פקודות שפה בפעולות רובוטיות.

Related terms