Glossary(으)로 돌아가기

DINOv2

MLVisionRepresentation Learning

Meta에서 자기 증류 목표를 사용하여 1억 4,200만 개 이미지의 큐레이션된 데이터셋에서 훈련한 자기 지도 비전 Transformer 모델. DINOv2는 레이블 없이 강력한 시각 표현을 학습함. 그 특징은 로보틱스 작업으로 잘 전이됨 — 동결된 DINOv2 인코더를 사용하는 조작 제어정책은 로봇 데이터에 대한 최소한의 미세 조정으로 강력한 성능을 달성함.

Related terms