CLIP
대조 언어-이미지 사전학습(Contrastive Language-Image Pre-training) — OpenAI가 400M개의 이미지-텍스트 쌍으로 학습한 모델로, 정렬된 시각 및 언어 표현을 학습합니다. CLIP 임베딩은 로봇공학에서 개방형 어휘 물체 감지, 언어 조건부 조작, 보상 명시에 사용됩니다. RT-2 및 SayCan과 같은 VLA 모델은 CLIP 스타일의 비전-언어 정렬을 활용하여 언어 명령을 로봇 동작에 연결합니다.
대조 언어-이미지 사전학습(Contrastive Language-Image Pre-training) — OpenAI가 400M개의 이미지-텍스트 쌍으로 학습한 모델로, 정렬된 시각 및 언어 표현을 학습합니다. CLIP 임베딩은 로봇공학에서 개방형 어휘 물체 감지, 언어 조건부 조작, 보상 명시에 사용됩니다. RT-2 및 SayCan과 같은 VLA 모델은 CLIP 스타일의 비전-언어 정렬을 활용하여 언어 명령을 로봇 동작에 연결합니다.