预训练
在大规模通用数据集上进行初始训练,然后在特定下游任务上进行微调。在机器人学习中,视觉编码器在 ImageNet 或互联网图像上预训练(ResNet、ViT、DINOv2),VLA 模型在互联网规模的视觉-语言数据上预训练。预训练提供鲁棒的特征表示,可转移到机器人感知任务,仅需有限的机器人特定数据。
在大规模通用数据集上进行初始训练,然后在特定下游任务上进行微调。在机器人学习中,视觉编码器在 ImageNet 或互联网图像上预训练(ResNet、ViT、DINOv2),VLA 模型在互联网规模的视觉-语言数据上预训练。预训练提供鲁棒的特征表示,可转移到机器人感知任务,仅需有限的机器人特定数据。