CLIP
Contrastive Language-Image Pre-training — OpenAIが400M個の画像テキストペアで訓練したモデルで、視覚と言語表現の整列を学習します。CLIPの埋め込みはロボット工学で開語彙物体検出、言語条件付き操作、報酬仕様に使用されます。RT-2やSayCanなどのVLAモデルはCLIPスタイルの視覚言語整列を活用して言語コマンドをロボット動作に接地します。
Contrastive Language-Image Pre-training — OpenAIが400M個の画像テキストペアで訓練したモデルで、視覚と言語表現の整列を学習します。CLIPの埋め込みはロボット工学で開語彙物体検出、言語条件付き操作、報酬仕様に使用されます。RT-2やSayCanなどのVLAモデルはCLIPスタイルの視覚言語整列を活用して言語コマンドをロボット動作に接地します。