Research(으)로 돌아가기

로봇 조작의 기초 모델: RT-2, OpenVLA, Octo, π0

2025년 로봇 조작에 대한 기초 모델 조사

[← 연구]

로봇 조작에 대한 대규모 사전 훈련된 모델의 현재 풍경은 그들이 무엇을 할 수 있고, 정비하는 데 드는 비용이 얼마나 많은지, 그리고 어떻게 선택해야 하는지입니다.

로봇 기반 모델 을 만드는 것

로봇 기반 모델은 다양한 로봇 상호작용 데이터 (그리고 종종 웹 데이터) 에 미리 훈련된 대규모 신경 네트워크로 비교적 적은 시범과 함께 새로운 작업에 정렬될 수 있습니다. GPT-4 또는 CLIP가 도메인 특정 NLP 또는 비전 작업에 정렬될 수 있는 방식과 유사합니다.

중요한 속성은 transferability: 모델은 명시적으로 훈련되지 않은 작업에 적용되는 객체, 장면 및 동작의 일반화 가능한 표현을 배워야 합니다. 많은 환경 및 로봇 유형에서 100,000+ 이상의 시범을 미리 훈련하는 것이 이러한 일반화성을 얻는 주요 메커니즘입니다.

기초 모델은 작업에 대한 정책보다 보편적으로 우월하지 않습니다. 잘 확장된 단일 작업 배포에 있어서, 500~1,000 작업에 대한 작업에 대한 잘 훈련된 ACT 또는 전파 정책은 정교한 기초 모델보다 더 좋은 결과를 얻을 수 있습니다. 기초 모델은 많은 새로운 작업에 빠르게 적응해야 할 때 (>분기마다 10 개의 새로운 작업) 또는 새로운 작업에 대한 시범이 거의 없을 때 (550 샷) 이 효과가 있습니다.

RT-2: 로봇 트랜스포머 2

RT-2 (Google DeepMind, 2023) 는 가장 많이 인용되는 로봇 기반 모델이다. 웹 이미지- 텍스트 데이터와 로봇 궤도 데이터의 조합을 동시에 훈련하여 텍스트로 토큰화된 로봇 동작을 출력하기 위해 큰 비전 언어 모델을 (PaLI-X, 55B 매개 변수) 를 미세합니다.

  • 건축: PaLI-X VLM 척추, 행동 토큰이 어휘에 첨부되어 있습니다. 행동들은 각 차원별로 256 개의 칸으로 분별되어 텍스트 토큰으로 해독됩니다.
  • ** 훈련 데이터:** ~ RT-1 데이터 세트 (Google 로봇 부엌 작업) 에서 130K 로봇 에피소드, 그리고 대규모 웹 텍스트/ 이미지 데이터. 웹 데이터는 핵심입니다.
  • ** 핵심 결과:** RT-2는 신기한 객체에서 62%의 성공률을 달성하고, 0샷 일반화로 신기한 배경에서 55%를 달성하며, RT-1의 32%와 28%를 각각 달성한다. "불을 끄는 데 사용할 수 있는 객체를 선택하라"와 같은 자연어 명령에 대응할 수 있다.
  • ** 인퍼런스 비용:** 55B 매개 변수를 실행하려면 멀티GPU 서버가 필요합니다. 가장자리 하드웨어에 배치 할 수 없습니다. 인퍼런스 지연시간 13초 느린 로봇 제어 루프에서만 허용됩니다.
  • ** 제한:** 폐쇄된 무게 (Google 내부). 외부 팀에서 직접 정렬할 수 없습니다. 후속 SayCan2는 여러 단계 작업 계획으로 확장됩니다.

오픈VLA

OpenVLA (스탠포드 + UC 버클리, 2024) 는 2025 년 현재 선도적인 오픈 웨이트 로봇 기반 모델이다. 그것은 오픈 X-Embodiment 데이터 세트에 정비된 DINOv2 + SigLIP 비전 코더와 7B 매개 변수 LLaMA-2 언어 모델에 기반한다.

  • ** 건축:** 프리스마틱 VLM (LLaMA-2 7B + DINOv2 비전 코더). 토큰화된 분별 (256 칸) 를 통해 행동 출력. 입력: 512 × 512 이미지 + 자연어 명령.
  • ** 훈련 데이터:** 오픈 X-Embodiment 데이터 세트 22개의 연구 기관에서 22개의 다른 로봇 유형에서 1백만 개 이상의 로봇 에피소드. 29개의 다른 로봇 실시예들이 나타났습니다.
  • ** 오픈 웨이트:** HuggingFace (openvla/openvla-7b) 에서 발행된 모델 웨이트. 표준 LoRA 또는 소비자 하드웨어에 완전한 정렬을 할 수 있습니다.
  • ** 정렬 비용:** 1,000개의 작업별 디스플레이에 LoRA 정렬 시기는 A100 GPU에서 약 48시간 (클라우드 컴퓨팅에서 500$$800) 소요된다.
  • 공급 속도는: ~500ms/행동 A100 (7B 파라마). 양자 INT4 버전은 ~100200ms에서 실행됩니다. 최적화 없이 >2Hz 제어에 적합하지 않습니다.
  • ** 성능:** BridgeV2 벤치마크 작업에 RT-2와 일치하거나 이른다. 보이지 않는 작업에 추가적인 정렬이 전혀 없는 5665%의 성공을 달성한다.

오토토

오크토 (버클리, 2024) 는 다른 건축적 접근 방식을 취하고 있습니다. 분포 정책 행동 헤드 (diffusion policy action head) 을 가진 작은 트랜스포머 모델, 로봇 데이터 (웹 데이터) 에 전적으로 훈련되어 있습니다. 이것은 미세조 및 배포를 더 빠르게 만듭니다.

  • 건축: 트랜스포머 관찰 코더 (사진 + 자기 수용 + 언어) + 전파 행동 헤드. 전체 매개 변수는 ~93M VLM 기반 접근 방식보다 크게 작습니다.
  • ** 훈련 자료:** 800,000개의 로봇 시범공단 (품질에 대한 필터링)
  • ** 인퍼런스 속도:** ~30100ms 표준 GPU에서 액션당. 가장자리 인퍼런스 위해 NVIDIA Jetson AGX Orin (275 TOPS) 에서 배포 할 수 있습니다.
  • ** 정밀 조정:** 1000개의 시범이 단일 A100에서 < 1시간 내에 정밀 조정되었습니다. VLM 기반 모델보다 훨씬 빠른 반복 주기.
  • ** 제한:** 자연어 의미학과 VLM 기반 모델을 이해하지 못합니다. 제로 샷 신기적인 객체 일반화에 더 나쁘습니다. 작업에 대한 정밀한 조정 데이터를 가지고 있는 시나리오에 더 좋습니다.

π0 (물리 지능)

π0 (Physical Intelligence, 2024) 은 유능한 쌍동력 조작을 위한 가장 유능한 보고된 로봇 기반 모델이다. 토큰화된 액션 출력에서 일부 분별 유물을 피하는 흐름 일치하는 액션 헤드 ( 연속적인 정상화 흐름 변종) 를 사용합니다.

  • 건축: VLM 척추 (PaLI-Gemma) + 흐름 일치 액션 헤드. 물리 지능의 로봇 함대에서 독자적인 데이터에 훈련.
  • 능력: 세탁기 접기, 테이블 버싱, 샌드위치 제작에 입증된 다른 모델이 맞지 않는 변형 가능한 물체와 높은 성 두 가지 작업.
  • ** 가용성:** 오픈 웨이트가 아닙니다. 물리 지능의 상업 API를 통해 사용할 수 있습니다.
  • ** 흐름 일치의 장점:** 흐름 일치는 토큰화된 행동 출력에서 요구되는 분별 칸을 피하고, 특히 높은 DOF 수동 및 쌍방향 작업에 중요한 더 원활하고 정확한 동작을 가능하게 한다.

능력 비교

Model Params Weights Zero-Shot Fine-Tune Cost Inference Speed Best For
RT-2 55B Closed Excellent N/A 1–3 s Google internal
OpenVLA 7B Open Good $500–$800 100–500 ms Open research, fine-tuning
Octo 93M Open Moderate <$100 30–100 ms Edge deployment, fast iteration
π0 ~3B Closed API Excellent Custom Unknown Dexterous bimanual
Task-specific ACT ~300M N/A None $50–$200 15–30 ms Single well-scoped task

배치 의 고려 사항

  • 량화: OpenVLA INT8량화 는 GPU 메모리를 14 GB에서 ~7 GB로 감소시켜서 <5%의 성능 저하를 합니다. INT4 (4 비트) 는 812%의 저하를 통해 ~3.5 GB로 감소합니다.
  • Edge 추론: Octo (93M 파램) 는 NVIDIA Jetson AGX Orin에서 편안하게 실행되는 유일한 현재 기반 모델입니다. OpenVLA 및 π0는 서버가 필요합니다. 더 큰 모델의 가장자리 배포를 위해, 이더넷을 통해 로봇에 연결된 공동 위치 GPU 서버에서 추론을 실행하는 것을 고려하십시오.
  • ** 정렬 데이터:** 기초 모델조차도 특정 목표 작업과 로봇에 대한 2001,000의 시범에서 실질적으로 혜택을 누립니다. 크로스 인체 전송은 불완전합니다.

RCSV 훈련 플랫폼 는 1 클릭 인터페이스로 OpenVLA 및 Octo 정교 조정을 지원합니다. 수집된 시범을 가져와 표준 벤치마크에 대한 계산, 하이퍼 파라미터 검색 및 평가 작업을 처리합니다.

데이터 에 대한 기초 모델 을 정밀 히 조정

RCSV는 작업에 대한 디스플레이 데이터에 대한 OpenVLA 및 Octo의 관리 된 정렬을 제공합니다. 우리는 GPU 제공, 훈련 및 평가를 처리합니다.

[기초 훈련 →]