Glossary(으)로 돌아가기

기초 모델

Robot LearningVision-Language

광범위한 데이터(인터넷 텍스트, 이미지, 비디오)에 대해 사전 학습된 대규모 신경망으로, 최소한의 미세 조정으로 다운스트림 작업에 적응할 수 있습니다. 로봇공학에서 기초 모델은 시각 표현(DINOv2), 언어 그라운딩(CLIP, LLM), 세계 모델(비디오 예측), 그리고 직접 로봇 액션을 출력하는 모델(RT-2, OpenVLA, π0 같은 VLA)을 제공합니다. 이들은 학습의 데이터 비용을 작업과 구체화 전반에 걸쳐 분산시킬 것을 약속합니다.

Related terms