Назад к Glossary

Модель фундамента

Robot LearningVision-Language

Крупномасштабная нейронная сеть, предварительно обученная на широких данных (интернет-текст, изображения, видео), которая может быть адаптирована к задачам нижестоящего уровня с минимальной тонкой настройкой. В робототехнике модели фундамента обеспечивают визуальные представления (DINOv2), языковое заземление (CLIP, LLMs), модели мира (предсказание видео) и прямой вывод действий робота (VLAs как RT-2, OpenVLA, π0). Они обещают амортизировать стоимость данных обучения между задачами и воплощениями.

Related terms