Blog(으)로 돌아가기

예산에 대한 VLA 모델 훈련의 규모: 100+의 피니 튜닝에서 배운 교훈

LoRA/QLoRA, gradient checkpointing, FlashAttention, A100/H100 vs. 소비자 GPU, 그리고 데이터 세트 vs. 모델 트레이드오프

7B 파라미터 시각 언어 행동 모델의 정밀 조정은 경계 연구소에서만 이루어지는 활동처럼 들립니다. 올바른 기본 모델, 올바른 파라미터 효율적인 방법, 최적화 할 수있는 올바른 실패 모드를 선택하면 아닙니다. 여기 우리가 이 루프를 수백 번 실행하는 것을 배웠습니다.

실리콘밸리 로봇센터 연구팀에서 2026-04-03에 발표되었습니다.

TL;DR. 유용한 VLA를 정렬하기 위해 H100 클러스터가 필요하지 않습니다. LoRA (또는 더 작은 예산에 QLoRA) 를 더하고 FlashAttention-2 및 그라디언트 체크포인팅을 가진 단일 H100는 몇 백 개의 에피소드에서 OpenVLA를 밤새 정렬합니다. 오ક્ટો는 오후에 소비자 24GB 카드에서 정렬합니다. 희귀한 자원은 거의 결코 FLOPs입니다. 요구에 따라 컴퓨팅을 구입하고 데이터에 구조적으로 투자하십시오. 작은 데이터 세트 및 단일 실시예에 대해 Octo를 선택하십시오. 500 에피소드 이상 또는 언어 조건이 필요한 경우 OpenVLA를 선택하십시오.

1· 예산의 틀을 올바르게 설정

GPU나 모델을 선택하기 전에, 예산은 하나의 숫자로 구성하세요. " 유용한 평가"에 대한 비용입니다. " 시대별 비용, 계층 단계별 비용, TFLOP별 비용"은 아닙니다. 유용한 평가는 실제 로봇에 대한 성공적인 배포이며, 고정된 평가 프로토콜에 의해 측정됩니다. 계산, 엔지니어 또는 데이터에 지출된 모든 달러는 그 숫자를 개선하는 데 추적되어야합니다.

이것은 명백한 것으로 들리는데, 일상적으로 위반됩니다. 팀은 벽 시계 시간을 15% 줄이기 위해 훈련 레시피를 최적화하는 데 6 주를 보내고, 평가 프로토콜이 실제 성공률에서 20 퍼센트 점 차이가있는 두 정책을 구별할 수 없다는 것을 발견합니다. 잘 기기된 평가 큐트는 두 번째 GPU보다 가치가 있습니다.

2. 데이터 세트의 크기에 따라 기본 모델을 선택하고, 권위에 따라 선택하지 마십시오

오토토

Octo는 디스플레이 데이터 세트가 작고 (사업당 약 500 에피소드), 구현은 하나의 알려진 팔이며, 개방형 어휘 언어 조건이 필요하지 않습니다. 그것은 몇 시간 내에 단일 24GB 소비자 GPU에 정밀 조정, 허용 라이선스를 가지고 있으며, 큰 VLA보다 소음 데이터를 더 용납합니다. 그 액션 디코더는 간단해서 실패 모드가 쉽게 진단될 수 있습니다.

오픈VLA

OpenVLA는 500개 이상의 시범을 할 때, 언어 조건화된 행동이나 크로스 인보디먼트 사전 훈련에서 혜택을 얻고 싶을 때 적절한 기본입니다. 7B 파라미터 기반은 로라와 함께 편안한 대량 크기의 경우 적어도 40GB A100 또는 이상적으로 80GB H100을 원할 것을 의미합니다. 참조 구현은 [github.com/openvla/vlaopen]T0에서 있습니다. VLA 모델 설명 포스트는 건축 측면을 다루고 있으며, 우리의 큐레이션 목록은 /vla-models/ 에 있습니다.

pi0 및 기타

여러 국경 VLA (pi0 및 후계자) 는 OpenVLA를 가장 어려운 작업에서 능가하지만 더 무거운 컴퓨팅 및 라이선스 비용을 부담합니다. 대부분의 팀에게는 이것은 조기 최적화입니다.

손가락 규칙. 모델을 두 배로 두배하기 전에 데이터 세트를 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 두 배로 세로 두 배로 두 배로 두 배로 세로 두 배로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세로 세 세로 세로 세 세 세 세로 세로 세로 세로 세로 세로 세로 세로 세 세 세 세로 세로 세 세 세 세로 세로 세

3. 매개 변수 효율적인 정렬: LoRA, QLoRA, 그리고 각 승자가 승리할 때

로라

로라는 각 관심과 MLP 무게에 작은 훈련 가능한 순위-r 어댑터 매트리스를 붙여서 기지를 얼리게 한다. 7B VLA에 있어서, 로라는 16-32 순위로 훈련 가능한 매개 변수를 100배로 줄이고, 메모리를 크게 낮추고, 우리의 경험에 따르면 대부분의 하류 조작 작업에 대한 완전한 정렬 성능을 일치시킨다.

QLoRA

QLoRA는 냉동 기본 모델을 4비트 NF4 양자화로 로로드하고 LoRA 어댑터를 위에 훈련시킵니다. 그것은 작은 처리 비용으로 로라의 메모리를 대략 반으로 줄입니다. QLoRA는 하나의 A100 40GB 또는 24-32GB의 소비자 카드에서 OpenVLA 정렬을 가능하게 만드는 것입니다. H100 액세스 할 수없는 팀에 대한 우리의 추천입니다. Hugging Face PEFT 라이브러리는 두 방법을 몇 줄 코드로 만듭니다.

언제 정밀 조정할 수 있을까요?

완전 미세조는 LoRA를 이기는 것은 (a) 매우 큰 데이터 세트를 (> 10k 에피소드, 실시예 다양) 또는 (b) 하류 작업은 사전 훈련과 충분히 다르므로 어댑터들은 격차를 줄일 수 없습니다. 대부분의 실무자에게는 이러한 조건이 유효하지 않습니다.

4. 실제로 중요한 메모리 및 처리량 트릭

플래시 주의 2

플래시 애트런션-2는 선택적이지 않습니다. 선택의 트랜스포머 라이브러리와 함께 묶인 버전을 사용하십시오. 1024 토큰 컨텍스트를 가진 7B 모델에서는 일반적으로 주의 메모리를 3-4배로 줄이고 끝에서 끝까지 훈련 속도를 20-40% 가 가 가집니다. 참고는 [github.com/Dao-AILab/flash-attention]

점진적 점검

메모리용 계산을 교환한다. 그라디언트 체크포인팅을 통해 7B 모델의 최고 활성화 메모리는 ~20-30%의 처리량 비용으로 약 2배로 떨어진다. 메모리 제한된 카드에서는 이것은 분명하게 승리합니다.

혼합 정확성 훈련

Ampere 및 Hopper에서 bfloat16을 사용하십시오. VLA 미세조음에서 수치 안정성을 위해 fp16보다 선호합니다. 메모리 소모가 활발하지 않으면 최적화 상태를 fp32에서 유지하십시오. 안정성 배당은 추가 메모리에 가치가 있습니다.

축적으로 이루어진 효과적인 배트 크기는

로라 미니 튜닝 에 있어서, 효과적 인 64-128 의 대량 은 대개 충분 한 것 보다 더 많지만, 더 높게 밀어내는 것 은 거의 도움 이 되지 않는다.

컴파일

PyTorch 2.x torch.compile는 대부분의 경우 코드 변경이 0%인 10-25%의 처리량을 제공합니다. 모델이 형태를 변화시키는 제어 흐름이 없는 한. 항상 레시피에 한 번 시도하는 것이 좋습니다.

5. 계산 선택: 무엇이 어디로 실행되는지

GPU VRAM OpenVLA (QLoRA) OpenVLA (LoRA bf16) Octo fine-tune Typical use
RTX 3090 / 4090 24GB Works, small batch Tight, small batch Comfortable Solo researchers, prototypes
A6000 / L40S 48GB Comfortable Works Very comfortable Small labs, shared workstation
A100 40GB 40GB Comfortable Works, modest batch Very comfortable Cloud default, good value
A100 80GB / H100 80GB 80GB Large batch Comfortable Overkill Production, multi-run sweeps

클라우드 가격도 매우 다양합니다. 주요 클라우드에서 스팟 인스턴스는 요구에 따라 40-70%를 견딜 수 있습니다.

6. 데이터 세트 크기와 모델 크기는: 실제 타협

100개 이상의 미세한 음향을 통해 우리의 경험에서, 하류 성공률의 가장 강력한 단 하나의 예측자는 모델 크기가 아니라 시범 데이터 품질입니다. 두 번째로 강력한 것은 작업에 적합한 카메라 설정입니다. 모델 크기는 세 번째입니다.

구체적으로: 200개의 험난하고 불합리한 레이블을 가진 시범을 위해 정비된 7B 오픈VLA는 한 날 동안 같은 200개의 시범을 통해 훈련된 작은 Octo보다 수적으로 낮은 성능을 발휘할 것이다. 우리의 큐레이션 및 검증된 데이터 세트는 [RCSV 데이터 세트 카탈로그] (T5) 에 위치하고 있으며, 우리의 [데이터 서비스] (T6) 팀은 큐레이션 작업을 수행합니다.

실용적인 결과물도 있습니다. 만약 당신의 정형조정이 작동하지 않는다면, 첫 번째 세 가지 가설은 모두 데이터에 관한 것이어야 합니다. 나쁜 에피소드 경계가, 일관성이 없는 행동 정상화, 녹음 세션 사이의 카메라 파동, 그리고 잘못된 레이블의 성공 플래그들은 우리가 진단한 정형조선의 실패의 대부분에 함께 책임이 있습니다.

7· 평가: 예산의 나머지 절반

정교한 VLA는 신뢰할 수 있는 평가 루프 없는 책임입니다. 우리는 다음과 같은 순서로 실행되는 세 가지 평가 모드를 권장합니다.

  • 오프라인 액션-MSE. 빠른 정신 건강 검진. 저렴. 실제 세계 성공을 예측하지 않습니다.
  • ** 인시프로 로플로웃.** 실제 작업을 반영하는 시프 환경. 로봇 시간을 태우기 전에 사전 필터로 유용합니다. 우리의 [시프로-현실 팁]
  • ** 실제 로봇 출범.** 유일한 진실의 원천. 평가당 최소 50개 출범을 예산. [부설 체크리스트]

전용 평가 로봇이 없는 팀들에서는 [RCSV 임대 프로그램]T9) 는 심사자의 요청과 재생가능성 보장에 유용한 가산화 하드웨어에 대한 평가 시간을 제공할 수 있다.

8· 예산 아케티프

개인 연구자 (월 0~500달러)

Octo 및 OpenVLA의 QLoRA 미세조음. 때때로 더 큰 실행을 위한 클라우드 스팟. 집중: 하나의 작업, 하나의 실시예, 엄격한 평가. 우리의 [LeRobot 시작]

작은 실험실 (월당 2~5만 달러)

A6000 또는 클라우드 통한 공유 A100. 기본으로 LoRA OpenVLA; 빠른 반복을 위해 Octo. 작업당 작은 (200-1000 에피소드) 큐레이션 데이터 세트에 크게 투자하십시오. [로봇 플랫폼을 비교하십시오]

기업 파일럿 (월 20~50만 달러)

H100 접근을 예약하고, 모든 실험에 다중 씨를 을 구축하고, 전용 데이터 큐레이션 파이프라인에 투자합니다. 이 예산에서는 단점은 거의 계산되지 않습니다. 그것은 데이터 처리량과 평가 엄격입니다. 우리의 [데이터 서비스]T12) 팀은 이 규모의 팀들을 위해 데이터 세트 구축을 처리합니다.

9· 일반적인 함정이

  • ** 과잉 훈련.** LoRA 어댑터는 작은 데이터 세트에 빠르게 과잉 적용된다.
  • 행동 정상화 불합시다. 만약 데이터 세트가 한 정상화로 기록되어 다른 정상화로 배포된다면, 종이 상에 건전한 정책이 나오고 하드웨어에서는 실패할 것입니다.
  • ** 카메라 파동.** 외부 캘리브레이션은 몇 달 동안 변한다. 주요 데이터 수집 실행 전에 재 캘리브레이트한다. [로봇 카메라 설정]
  • ** 에피소드 경계 오류.*** 만약 데이터 세트가 잘못된 에피소드를 가지고 있다면, LoRA는 의무적으로 잘못된 것을 배우게 될 것입니다.
  • ** 존재하지 않는 격차를 주장하는 것.** 만약 당신이 지연한 평가에서 50개의 실험을 하고 5%의 차이를 보시면 측정의 노이즈가 나오고, 결과는 나오지 않습니다. 통계적 능력에 대한 예산입니다.

10· 마무리 지명

VLA 정렬 플레이북은 더 이상 연구 연구소에서만 사용되지 않습니다. Octo 및 OpenVLA 더 이상 LoRA 더하여 단일 작업, 단일 구현 문제에서 출판 품질 결과를 생산하기에 충분합니다. 성공한 팀을 어려움을 겪는 팀에서 구별하는 것은 계산이 아닙니다. 그것은 데이터, 평가 및 하드웨어 캘리브레이션을 일급 엔지니어링으로 취급하는 학문입니다. 그에 따라 지출하세요.

하드웨어에 대해서는 스토어, 비 비교 도구, 구매자 가이드 는 프로그램을 크기로 가장 빠른 방법입니다. 벤치 수준의 세부 사항에 대해서는 튜토리얼 를 통해 구체적인 훈련 레시피를 살펴보십시오. 규모로 평가할 준비가되면 연락하십시오.

** 관련 읽기:** VLA 모델 설명, 텔레오퍼레이션 데이터 품질 체크리스트, 오픈소스 로봇 스택 2026, 그리고 로봇 학습 상태 Q1 2026.

11· 자주 묻는 질문

로라 순위가 중요합니까?

16-32 순위는 대부분의 VLA 미세조리에 적합합니다. 8 순위는 때때로 쌍방법 작업에 미치지 않습니다. 64 순위는 때때로 작은 데이터 세트에 과장됩니다. 확실하지 않으면 32에서 시작하여 특정 증상이있는 경우에만 조정하십시오.

처음부터 훈련해야 할까요?

거의 절대. 7B VLA를 처음부터 미리 훈련시키는 것은 미세 조정을 비관할만한 예산이 필요합니다. OpenVLA 또는 Octo 체크포인트에서 시작하십시오. 처음부터 훈련하는 유일한 경우는 오픈 체크포인트가 덮지 않는 진정한 신기한 행동 공간입니다.

훈련이 끝나면 어떻게 결정해야 할까요?

손실 곡선으로 하지 않습니다. 실제 로봇에서 지속된 평가 성공률을 통해. 평가 예산을 정하고 (예: 체크포인트당 50 개의 로롤) 그리고 그 메트릭에 대해 초기 정지, 인내심 1~3 개의 평가 실행을 통해.

방출 정책 메모리 사용은 어떨까요?

디스푸시온 정책은 VLA보다 가벼운 경우가 많기 때문에 시각 척추가 작기 때문입니다. 단일 24GB 카드에서는 대부분의 테이블톱 작업에 편안하게 훈련합니다. 병목은 일반적으로 GPU 메모리가 아니라 데이터 로딩입니다.