Voltar para Glossary

CLIP

Robot LearningVision-Language

Contrastive Language-Image Pre-training — um modelo treinado pela OpenAI em 400M pares imagem-texto para aprender representações visuais e linguísticas alinhadas. Os embeddings CLIP são usados em robótica para detecção de objetos com vocabulário aberto, manipulação condicionada por linguagem e especificação de recompensa. Modelos VLA como RT-2 e SayCan aproveitam o alinhamento visão-linguagem estilo CLIP para fundamentar comandos de linguagem em ações robóticas.

Related terms