返回Glossary

基础模型

Robot LearningVision-Language

在广泛数据(互联网文本、图像、视频)上预训练的大规模神经网络,可以通过最少的微调适应下游任务。在机器人学中,基础模型提供视觉表示(DINOv2)、语言接地(CLIP、LLM)、世界模型(视频预测)和直接输出机器人动作(VLA如RT-2、OpenVLA、π0)。它们承诺在任务和具身化之间摊销学习的数据成本。

Related terms