Research(으)로 돌아가기

오픈VLA와 오ક્ટો: 어떤 로봇 학습 모델을 선택해야 하는가?

오픈VLA와 오크토 비교: 건축, 훈련 데이터, 정비, 배포. 로봇에 대한 VLA 모델은 무엇입니까? 실리콘밸리의 로봇 센터.

[← 연구]

시각 언어 행동 (VLA) 모델을 선택하는 연구자와 건설자들에 대한 실용적인 비교.

VLA 모델은 인식 + 언어를 행동으로 지도합니다

이미지 언어 행동

[OpenVLA] (T1) 와 [Octo] (T2) 는 로봇 학습을 위한 오픈소스 시각 언어 액션 모델입니다. 이 두 가지의 비교와 언제 사용해야 하는지 살펴보면 다음과 같습니다.

건축

OpenVLA는 Prismatic VLM를 기반으로 동작 예측 헤드를 추가하고 있습니다. 여러 로봇 형상과 동작 공간을 지원합니다. Octo는 오픈 X-Embodiment 데이터에 훈련된 트랜스포머 기반 아키텍처를 사용합니다. 둘 다 이미지 + 언어 및 출력 동작을 촬영합니다.

교육 자료

OpenVLA는 오픈 X-Embodiment 및 추가 데이터 세트에 대한 훈련을 받고 있습니다. Octo는 오픈 X-Embodiment (RT-X, BridgeData, DROID, 등) 에 대한 훈련을 받고 있습니다. 둘 다 대규모의 다양한 로봇 데이터에서 혜택을 누립니다. 데이터 소스를 위해 우리의 [데이터 세트 카탈로그] (T3) 를 참조하십시오.

미세 조율

두 가지 모두 로봇과 작업에 대한 정렬을 지원합니다. 일반적으로 50~500개의 시범은 성능을 크게 향상시킬 수 있습니다. OpenVLA는 다양한 로봇 유형에 대한 체크포인트를 제공합니다. Octo의 아키텍처는 새로운 액션 공간에 유연합니다.

OpenVLA를 언제 선택해야 하는가

  • 일반적인 조작 작업에서 강력한 엑스-오프-오프-the-box 성능이 필요합니다
  • 당신의 로봇은 오픈 X-Embodiment (WidowX, ALOHA, 등) 에 있는 것과 비슷합니다.
  • 잘 기록된, 적극적으로 유지되는 모델이 필요해요

오크토 를 언제 선택 해야 합니까?

  • 당신은 새로운 로봇 형식과 실험하고 있습니다
  • 사용자 지정 액션 공간에 대한 최대 유연성을 원하고 있습니다
  • 당신은 직접 오픈 X-Embodiment 데이터를 기반으로

정렬 을 위한 데이터 수집

어떤 모델이든, 당신은 작업에 대한 구체적인 시범이 필요할 것입니다. 우리는 [데이터 수집 서비스] (T4) 를 모방 학습, 텔레오퍼레이션, 학습 준비 포맷 및 QA에 위해 제공합니다. 빠른 반복을 위해 샌프란시스코에서 같은 날 하드웨어 픽업.

모든 VLA 모델을 참조하십시오

평가에 대해 읽는 것은 한 가지 실제 하드웨어에 대한 정책을 증명하는 것은 다른 것입니다.

실제 평가판을 실행하라 → 위원회 평가 자료가 있는 것 → 당신의 평가판에 대한 하드웨어가 있는 것 →