Retour à Glossary

Politique conditionnée par le langage

VLAFoundation ModelGeneralization

Une politique conditionnée par le langage prend une instruction en langage naturel (par exemple, « prendre la tasse rouge et la placer sur le plateau ») comme entrée supplémentaire aux côtés d'observations visuelles, permettant à un seul réseau de politique d'effectuer plusieurs tâches sélectionnées à l'exécution sans réentraînement. Le conditionnement par langage est généralement implémenté en codant les instructions avec un modèle de langage préentraîné (CLIP, T5, PaLM) et en fusionnant l'embedding résultant avec les caractéristiques d'image. Les modèles VLA tels que RT-2, OpenVLA et pi0 sont conditionnés par langage par conception. Cette approche réduit le besoin d'entraîner des politiques séparées par tâche et supporte la généralisation zéro-shot à des formulations d'instructions nouvelles. Voir cela en pratique : nos évaluations en monde réel →

Related terms