Retour à Glossary

RT-2

Robot LearningVLA

Robotics Transformer 2 — un modèle VLA de Google DeepMind qui affine un grand modèle vision-langage (PaLI-X ou PaLM-E) pour générer les actions du robot sous forme de jetons texte. RT-2 démontre que le pré-entraînement à l'échelle d'Internet permet aux robots de suivre des instructions en langage naturel inédites et de généraliser à des objets et scénarios non vus. Il représente le paradigme consistant à traiter la prédiction d'actions du robot comme un problème de modélisation vision-langage.

Related terms