Retour à Glossary

Modèle de fondation

Robot LearningVision-Language

Un grand réseau de neurones pré-entraîné sur des données larges (texte internet, images, vidéos) qui peut être adapté aux tâches en aval avec un ajustement fin minimal. En robotique, les modèles de fondation fournissent des représentations visuelles (DINOv2), l'ancrage linguistique (CLIP, LLMs), des modèles du monde (prédiction vidéo) et produisent directement des actions de robot (VLAs comme RT-2, OpenVLA, π0). Ils promettent d'amortir le coût des données d'apprentissage entre les tâches et les incarnations.

Related terms