DINOv2
由 Meta 在 1.42 亿张精选图像数据集上使用自蒸馏目标训练的自监督视觉 Transformer 模型。DINOv2 在没有任何标签的情况下学习强大的视觉表示。其特征在机器人任务中迁移效果良好——使用冻结 DINOv2 编码器的操纵策略在机器人数据上以最少微调实现强大性能。
由 Meta 在 1.42 亿张精选图像数据集上使用自蒸馏目标训练的自监督视觉 Transformer 模型。DINOv2 在没有任何标签的情况下学习强大的视觉表示。其特征在机器人任务中迁移效果良好——使用冻结 DINOv2 编码器的操纵策略在机器人数据上以最少微调实现强大性能。