Назад к Glossary

CLIP

Robot LearningVision-Language

Contrastive Language-Image Pre-training — модель, обученная OpenAI на 400M пар изображение-текст для изучения согласованных визуальных и лингвистических представлений. Встраивания CLIP используются в робототехнике для обнаружения объектов с открытым словарём, манипуляции, обусловленной языком, и спецификации вознаграждения. Модели VLA, такие как RT-2 и SayCan, используют выравнивание видения и языка в стиле CLIP для привязки языковых команд к робототехническим действиям.

Related terms