RT-2
Robotics Transformer 2 — Google DeepMind의 VLA 모델로, 대규모 비전-언어 모델(PaLI-X 또는 PaLM-E)을 미세조정하여 로봇 액션을 텍스트 토큰으로 출력합니다. RT-2는 인터넷 규모의 사전학습이 로봇이 새로운 언어 지시를 따르고 보이지 않은 객체와 시나리오에 일반화할 수 있게 함을 보여줍니다. 이는 로봇 액션 예측을 비전-언어 모델링 문제로 다루는 패러다임을 나타냅니다.
Robotics Transformer 2 — Google DeepMind의 VLA 모델로, 대규모 비전-언어 모델(PaLI-X 또는 PaLM-E)을 미세조정하여 로봇 액션을 텍스트 토큰으로 출력합니다. RT-2는 인터넷 규모의 사전학습이 로봇이 새로운 언어 지시를 따르고 보이지 않은 객체와 시나리오에 일반화할 수 있게 함을 보여줍니다. 이는 로봇 액션 예측을 비전-언어 모델링 문제로 다루는 패러다임을 나타냅니다.