DINOv2
Metaが1億4200万枚の厳選された画像データセットで自己蒸留目的を使用して訓練した自己教師あり視覚Transformerモデル。DINOv2は任意のラベルなしで強力な視覚表現を学習します。その特徴はロボティクスタスクに良好に転移します。凍結されたDINOv2エンコーダを使用する操作制御ポリシーはロボットデータでの最小限のファインチューニングで強力なパフォーマンスを達成します。
Metaが1億4200万枚の厳選された画像データセットで自己蒸留目的を使用して訓練した自己教師あり視覚Transformerモデル。DINOv2は任意のラベルなしで強力な視覚表現を学習します。その特徴はロボティクスタスクに良好に転移します。凍結されたDINOv2エンコーダを使用する操作制御ポリシーはロボットデータでの最小限のファインチューニングで強力なパフォーマンスを達成します。