Назад к Glossary

RT-2

Robot LearningVLA

Robotics Transformer 2 — модель VLA от Google DeepMind, которая дообучает большую модель зрения-языка (PaLI-X или PaLM-E) для вывода действий робота в виде текстовых токенов. RT-2 демонстрирует, что предварительное обучение в масштабе интернета позволяет роботам следовать новым языковым инструкциям и обобщаться на невидимые объекты и сценарии. Это представляет парадигму, в которой предсказание действия робота рассматривается как задача моделирования зрения-языка.

Related terms