Blog(으)로 돌아가기

로봇 학습에 대한 확장 법칙: 2026 년 에 우리가 알고 있는 것

로봇 학습에 확장 법칙이 적용되는가? 오픈 X-Embodiment, RT-X, DROID의 증거와 2026년 데이터 수집, 모델 크기와 컴퓨팅 예산에 대한 실질적인 영향

[← 블로그]

로봇 학습은 자체적으로 확장 동력을 가지고 있으며, 데이터 수집 예산, 모델 크기를 선택하는 방법, 컴퓨팅 인프라를 계획하는 방법에 따라 언어 모델과 다를 수 있습니다.

규모 를 측정 하는 법 은 무엇 이며, 그 들 이 중요 한 이유

확장 법칙은 자원 입력 (데이터, 계산, 모델 매개 변수) 와 모델 성능 사이의 예측 가능한 관계를 설명합니다. 대규모 언어 모델에서, 칠라 논문 (Hoffmann et al., 2022) 는 최적의 훈련이 모델 크기와 데이터 세트 크기를 비례적으로 확장해야 한다고 정했습니다. 데이터를 두 배로 두 배로 늘려도 없이 매개 변수를 두 배로 늘리는 것이 최저 최적의 모델을 생성합니다. 이 프레임워크는 ML 팀들이 자원을 약속하기 전에 예산을 할당하고 성과를 예측하는 원칙적인 방법을 제공했습니다.

확장 법칙의 실질적 가치는 학문적이지 않습니다. 그들은 데이터 수집이나 더 큰 GPU 클러스터에 추가로 100만 달러를 지출하는 것이 더 많은 능력 향상을 가져올지 알려줍니다. 그들은 현재 접근 방식이 천장을 때리고 더 많은 자원보다는 구조적 변화가 필요할 때 알려줍니다. 그리고 그들이 여러분에게 여러분이 지금 행진을 따라가면서 성능 목표를 달성할 것인지 아니면 근본적으로 다른 접근 방법이 필요한지 알려줍니다.

로봇의 핵심 질문은, 비슷한 법칙이 적용되고, 그렇다면 어떤 예측이 이루어지는지? 2026년까지 우리는 뉘앙스된 하지만 실행 가능한 답을 줄 수 있는 충분한 경험적 증거가 있습니다.

로봇 스칼링이 언어 모델 스칼링과 어떻게 다르는가

증거들을 조사하기 전에, 로봇 학습 스칼링 법칙이 LLM 스칼링 역학의 단순한 복사본이 될 수 없는 이유를 이해하는 것이 중요합니다. 세 가지 구조적 차이점은 게임을 근본적으로 변화시킵니다.

** 데이터 수집은 비싸고 느립니다.** LLM 교육 데이터 (인터넷에서 온 텍스트) 는 기본적으로 아무것도 얻지 못합니다. 병목은 계산입니다. 로봇 시범 데이터 수집은 에피소드당 $5-50 (운전 시간, 하드웨어 사용, 품질 보장) 이며 수집 처리량은 사용할 수 있는 물리적 로봇 역의 수에 의해 제한됩니다. 이것은 최적화 문제를 뒤집어 버립니다. 로봇 학습에 있어서 문제는 "우리가 얼마나 많은 컴퓨팅을 할 수 있을까?"는 것이 아니라 "우리가 얼마나 많은 다양한 데이터를 수집할 수 있을까?"

** 데이터 유통은 멀티모달 및 물리학과 결합되어 있다.** 언어 모델 훈련 데이터는 비교적 균일한 유통 (인터넷의 텍스트) 에서 샘플링된다. 로봇 학습 데이터는 기본적으로 멀티모달입니다. 시각 관측, 자기 수용 상태, 힘 피드백 및 시간 역학을 결합합니다. 정책은 이 고차원 입력 공간에서 물리적으로 유효한 모터 명령에 대한 지도를 배워야 합니다. LLM에 더 많은 텍스트를 추가하는 것은 항상 도움이 됩니다. 로봇 정책에 더 많은 시범을 추가하는 것은 입력 공간의 새로운 지역을 포함하는 경우에만 도움이 됩니다.

평가 는 물리적으로 기초 를 둔다. LLM 성능 은 수량 에 있는 텍스트 벤치마크 에 의해 평가 될 수 있다. 로봇 정책 성능 은 물리적인 하드웨어 에 대한 정책 을 실행 함 으로만 실제 로 평가 될 수 있다. 이는 느리고 비싸고 하드웨어 변동 에 의해 적용된다. 이것은 스케일링 곡선을 정확하게 특징화 하는 것을 더 어렵게 하고, 실증적 측정 에 소음을 도입 한다.

증거: 오픈 X-Embodyment 및 RT-X

오픈 X-Embodiment 프로젝트 (파달카르 등, 2023) 는 33개 연구 기관의 22개의 다른 로봇 실시예에서 1백만 개의 로봇 조작 에피소드를 수집했다. 이 데이터에 훈련된 RT-X 모델은 크로스-인체 확장에 대한 첫 번째 대규모 증거를 제공했다.

주요 발견은 눈에 띄었습니다. RT-2-X는 전체 다체체 데이터 세트에 훈련되어 있으며, 일 로봇 전문 정책보다 50% 정도 더 많은 일반화 작업에 성공했습니다. 이것은 다른 로봇 유형의 데이터가 모델에 소음이 아니라 새로운 로봇과 새로운 작업에 일반화를 향상시키는 전송 가능한 조작 지식을 포함합니다. 스칼링은 LLM 스칼링 곡선처럼 부드럽고 예측할 수 없었지만 방향은 명확하고 일관했습니다.

특히 RT-X 결과는 어떤 것을 전송하는지에 대한 계층성을 나타냈다. 시각적 장면 이해는 구현물들 사이에서 가장 쉽게 전송되었다. 높은 수준의 작업 개념 (픽, 위치, 오픈, 클로즈) 은 중간적으로 잘 전송되었다. 낮은 수준의 모터 제어 (특별한 관절 궤도, 정확한 접촉 시기는) 는 transfer를 잘 하지 않았고 여전히 구현물별 정교한 조정이 필요했다.

증거: DROID 및 데이터 스케일링

DROID 데이터 세트 (Khazatsky et al., 2024) 는 로봇 조작에 대한 데이터 스케일링에 대한 가장 포괄적인 경험적 연구입니다. 86 개의 연구소, 22 개의 로봇 유형 및 564 개의 다른 환경에서 수집된 76,000 개의 시범으로, DROID는 연구자들이 데이터 양과 데이터 다양성에 따라 정책 성능이 어떻게 독립적으로 확장되는지를 테스트 할 수있게했습니다.

중요한 결과는: 데이터 다양성 규모는 데이터 볼륨보다 성능을 더 안정적으로 측정합니다. 작가는 DROID 데이터의 하위 집합을 증가시키는 데 ACT 및 퍼포시전 정책을 훈련했을 때, 그들은 대략 10,000 개의 시범으로 일관된 개선, 30,000 개에서 감소하는 수익률, 그리고 내 배포 성능에 대해 거의 50,000 개에서 일관된 개선을 관찰했습니다. 그러나 다양한 데이터를 추가 (새로운 환경, 새로운 객체 범주) 는 이미 보인 시나리오의 더 많은 시나리오를 추가한 후에도 배포되지 않은 성능을 개선하는 것을 계속했습니다.

언어 모델 스케일링과는 근본적인 구조적 차이점입니다. 같은 배포에서 더 많은 웹 텍스트는 언어 모델을 계속 개선합니다. 같은 환경에서 동일한 작업을 더 많이 시범하는 것은 비교적 낮은 천장을 넘어 로봇 정책을 계속 개선하지 않습니다. 병목은 다양성입니다.

로봇 학습 에서 잘 측정 되는 것

** 시각 표현의 질.** 더 큰 사전 훈련된 시각 엔코더 (DINOv2-Large vs DINOv2-Base, SigLIP-400M vs SigLIP-100M) 는 지속적으로 조작 정책에 대한 더 나은 시각적 기능을 생산합니다. 여기서 확장자는 컴퓨터 비전에서 익숙한 패턴을 따르습니다. 더 큰 모델은 더 풍부하고 더 일반화 가능한 시각적 표현을 학습합니다. 이것은 로봇 학습에서 가장 LLM와 유사한 확장 동화입니다.

프레트레이닝 데이터의 작업 다양성. 더 많은 작업 범주에서 미리 훈련된 정책은 새로운 작업에 더 잘 일반화됩니다. 이 축에 대한 오픈 X-Embodiment 결과는 견고하고 후속 작업에서 복제되었습니다. 사전 훈련 혼합에 추가된 각 추가 작업 카테고리는 수행된 작업에 대한 제로샷 성능을 향상시킵니다. 현재 데이터 세트의 한계에 이르기까지 감소하지만 긍정적 인 수익이 관찰됩니다 (사업 카테고리 수백 개).

체육관 간 전송. 훈련 전용 로봇에 추가로 추가된 로봇 타입의 데이터를 추가하면, 훈련 세트의 다른 로봇과 운동적으로 다른 로봇이 있을 때에도 새로운 목표 로봇에 대한 일반화가 향상된다. 이 메커니즘은 다양한 실시예 데이터로 인해 모델이 하나의 로봇의 운동학에 과도하게 적응하지 않고 실시예-아고스틱 조작 표현을 배우게 됩니다. 이것은 훈련 세트의 실시예 수와 안정적으로 확장됩니다.

환경 다양성. 더 많은 물리적 환경 (다양한 방, 조명 조건, 테이블 표면) 에서 실시된 시범을 바탕으로 훈련된 정책들은 새로운 배포 환경으로 더 잘 일반화된다. 이것은 대략 20개의 환경까지의 개별 환경의 수와 함께 선형적으로 확장되며, 그 다음에는 감소하는 수익률이 있다.

깨끗 한 척도 를 하지 않는 것

정확한 현명한 조작. 미세 미터 정확성을 필요로 하는 작업 (선, 삽입, 나 운전) 은 더 많은 데이터 또는 더 큰 모델로 예측 가능한 발전을 하지 않는다. 단점은 시각적 표현의 품질이나 작업 지식이 아닙니다. 정확한 접촉 동력은 객체 특정 속성에 민감합니다 (토화, 준수, 기하학) 이는 일반화를 물리치는 방식으로 사례마다 다릅니다. 더 많은 데이터가 도움이되지만, 확장 곡선은 거대 조작 작업에 비해 고 소란적입니다.

** 접촉 역학.** 객체 특성에 기초하여 압축력을 조절해야 하는 정책 (약성 vs 강성, 딱딱성 vs 변형성) 은 데이터 스케일링만으로도 제한적인 개선이 나타난다. 문제는 접촉 관련 특성이 카메라에 보이지 않는다는 것입니다. RGB 이미지에서 객체의 마찰 계수 또는 준수성을 볼 수 없습니다. 힘과 동동력 센서 데이터는 도움을 주지만 자체 분배 전환 문제를 도입합니다. 이것은 하이브리드 접근 방식 (학습된 인식 + 고전적 힘 제어) 이 학습된 정책의 순수한 확장보다 우위를 하는 영역입니다.

장기적 작업 계획. 10개 이상의 연속적인 하위 작업 실행이 필요한 작업에 있어서, 데이터에 따라 성공률은 저조합니다. 합성 오류 문제는 95%의 단계별 성공률을 가진 정책에서도 10단계 작업에 60%의 성공률을 달성하고, 20단계 작업에 36%의 성공률을 달성한다는 것을 의미합니다. 더 많은 데이터가 단계별 신뢰성을 향상시키지만 합성 수학적 변화를 일으키지 않습니다. 계층적 정책 (고급 계획자 + 낮은 수준의 기술) 은 이를 완화하지만, 고급 계획자의 확장 동기는 기술 수준 확장보다 잘 특징이 없습니다.

** 모델 매개 변수는 정교한 정책에 의해 계산된다.** 더 큰 것이 지속적으로 더 나은 언어 모델과 달리, 작업에 대한 정교한 작업에 대한 모델 크기와 조작 성능 사이의 관계는 단조적이지 않습니다. OpenVLA (7B 매개 변수) 는 0-샷 작업에서 Octo (93M) 를 능가하지만 200+ 작업에 대한 정교한 작업에 대한 단조에 대한 감소적인 이점을 제공합니다. 전용 데이터 수집 예산을 가진 팀들에서는 잘 조정된 작은 모델은 가볍게 적응된 큰 모델보다 더 실용적입니다.

왜 산업이 로봇 데이터를 수집하기 위해 경쟁하고 있는 걸까요?

확장 증거는 2026년 모든 주요 로봇 회사와 연구실이 실제 로봇 데이터 수집 인프라에 많은 투자를 하는 이유를 설명합니다. 다양성이 병목이 되고 다양성이 많은 로봇에 많은 객체를 가진 많은 환경에서 데이터를 수집해야 한다면, 다양한 로봇 데이터를 규모로 생성할 수 있는 조직에 경쟁 우위가 쌓이게 됩니다.

물리 지능, 구글 딥마인드, 토요타 연구소, 그리고 많은 잘 자금 지원된 스타트업들이 수십 개의 로봇 스테이션, 표준화된 작업 프로토콜 및 전문 운영자들로 대규모 데이터 수집 시설을 구축하거나 구축했습니다. 논리는 바로 이것입니다. 가장 다양한 로봇 조작 데이터를 가진 사람은 최고의 기초 모델을 훈련시킬 것이고, 가장 좋은 기초 모델은 가장 적은 고객별 정교한 조정이 필요할 것입니다.

RCSV는 이 생태계에서 특별한 역할을 합니다. 우리는 다양한, 고품질의 조작 데이터를 필요로 하지만 자체 수집 시설을 구축하고 인력을 갖춰주고 싶지 않은 팀들에게 데이터 수집 인프라와 전문 운영자를 제공합니다. 우리의 [데이터 서비스] (T2) 는 이 문서에서 설명한 확장 동력을 중심으로 구성되어 있습니다. 단순히 에피소드 수를 극대화하는 것보다 객체, 환경 및 작업 구성의 다양성을 극대화합니다.

연구 연구소 들 에게 이 무슨 의미 입니까?

학술 연구실에서는 산업이 하지 않는 확장 과제를 직면하고 있다. 대학 연구실은 일반적으로 1-3 개의 로봇 팔, 한 방, 그리고 객체 조달 및 운영시간에 제한된 예산을 가지고 있다. 확장 증거는 투자하는 가장 영향력 있는 차원은 다양성, 비 부피라고 말한다. 실용적인 영향:

  • 기본 모델을 사용하세요. 사전 훈련된 모델 (Octo, OpenVLA) 은 단일 연구소에서 복제할 수 없는 다체체, 다 작업 기반을 제공합니다. 처음부터 훈련하는 대신 특정 작업에 정밀하게 조정하십시오.
  • ** 달러당 객체 다양성을 극대화 합니다.** 3가지 비싼 정밀품보다는 30가지의 다른 객체를 재고점에서 구입하세요.
  • ** 여러 방에서 수집.** 실험실, 부엌, 사무실 사이에 설정을 옮기는 것은 불편하더라도 환경 다양성을 제공하여 정책의 탄력성을 크게 향상시킵니다. 100개의 디모가 있는 3개의 환경은 배포 밖 일반화를 위해 300개의 디모가 있는 한 환경을 능가합니다.
  • ** 오픈 데이터 세트에 기여하고 그 자료를 추출하십시오.** Open X-Embodiment, DROID, 그리고 Bridge V2는 무료 확장형으로 훈련 파이프라인에 추가할 수 있습니다. 추가적인 시범을 수집하지 않고도.

이 점 은 기업 들 에게 무슨 의미 입니까?

생산 로봇 시스템을 구축하는 기업은 다른 확장 과제를 직면합니다. 그들은 일반적으로 특정 배포 환경과 특정 작업 포트폴리오를 가지고 있습니다. 확장 증거는 단계적 접근을 제안합니다.

  • 단계 1: 기초 모델 선택. 로봇 타입과 작업 영역에 대한 최고의 사전 훈련된 모델을 시작하세요. 이것은 수집 비용 없이 커뮤니티 규모의 데이터 다양성의 혜택을 제공합니다.
  • 단계 2: 목표형 정렬. 특정 배포 환경에서 특정 작업의 200-500 개의 시범을 수집하십시오. 목표 SKU 카테고리 내에서 객체 다양성과 작업 공간 내에서 위치 다양성에 집중하십시오.
  • 단계 3: 지속적인 개선. 정교한 정책을 적용하고, 실패 모드를 식별하기 위해 기록된 배포 데이터를 사용 (인간의 성공/실패 라벨을 가지고) 합니다. 이러한 실패를 해결하기 위해 목표 데이터를 수집합니다. 이 부분에서 다양성 과 부피 원칙이 가장 중요합니다. 이미 가지고 있는 데이터를 다시 수집하지 마십시오. 격차를 덮는 데이터를 수집합니다.
  • 단계 4: 사이트 간 규모. 각 새로운 배포 사이트는 기본 정책을 개선하는 환경 다양성을 제공합니다. 모든 사이트에서 데이터를 중앙 훈련 풀로 다시 흐르게 할 배포 데이터 파이프라인을 구성합니다. 이것은 배포 규모를 데이터 규모의 장점으로 만듭니다.

데이터 양 대 모델 크기와 성능: 숫자

Configuration Model Size Training Data In-Distribution Success OOD Success
ACT from scratch ~30M params 100 demos 75-85% 20-35%
ACT from scratch ~30M params 500 demos 88-93% 35-50%
Octo (fine-tuned) 93M params OXE + 200 task demos 85-92% 45-60%
OpenVLA (fine-tuned) 7B params OXE + 200 task demos 88-95% 55-70%
OpenVLA (fine-tuned) 7B params OXE + 500 task demos 92-97% 60-75%

이 숫자의 핵심은 200개의 작업별 디모네스트를 가진 정교한 기초 모델이 일반적으로 500개의 디모네스트를 가진 처음부터 같은 모델과 일치하거나 초월합니다. 배포 및 배포 밖 모두입니다. 기초 모델의 장점은 완전히 OOD 일반화입니다. 그것은 새로운 객체와 환경에 대해 20-30 퍼센트 포인트 향상시킵니다. 분포상의 이점은 더 작다 (5-10점) 그리고 종종 작은 평가 집합으로 통계적으로 중요하지 않습니다.

비용 예측: 데이터 수집과 계산

Resource 100 Demos 500 Demos 2,000 Demos 10,000 Demos
Data collection (RCSV rates) $2,500 $6,000 $18,000 $65,000
Training compute (ACT, single A100) $5 (2 hrs) $10 (4 hrs) $25 (10 hrs) $60 (24 hrs)
Training compute (OpenVLA fine-tune, 4x A100) $50 (5 hrs) $100 (10 hrs) $300 (30 hrs) $800 (80 hrs)
Data-to-compute cost ratio 50:1 to 500:1 60:1 to 600:1 60:1 to 720:1 80:1 to 1083:1

로봇 학습의 데이터-컴퓨터 비용 비율은 언어 모델 교육과 크게 다르며, 컴퓨터가 지배적인 비용이다. 로봇 학습에서는 데이터 수집이 데이터에 대한 훈련에 대한 계산보다 50-1000배 더 많은 비용이 발생한다. 이것은 직접적인 전략적 의미를 가지고 있습니다. 모든 소외 달러는 더 큰 모델이나 더 긴 교육 라인에 투자하지 않고 데이터 품질과 다양성을 향상시키는 데 사용되어야 합니다. 5,000달러의 예산은 200개의 다양한 시범에 투자할 때 보다 다양한 데이터 세트에 대한 훈련에 10배 더 많은 계산에 투자할 때 더 많은 능력 향상을 만들어냅니다.

스케일링 곡선 데이터 포인트: 경험적 성능 대 데이터 세트 크기

다음 표는 발표된 논문 및 RCSV 내부 평가에서 성능 데이터 포인트를 수집하여, 작업 성공률이 다른 아키텍처의 데이터 세트 크기와 어떻게 확장되는지를 보여줍니다. 모든 숫자는 단일 작업 테이블톱 선택과 장소로 평가되어, 유지된 객체 위치에서 평가됩니다.

Demo Count ACT (from scratch) Diffusion Policy Octo (fine-tuned) OpenVLA (fine-tuned)
10 15-25% 10-20% 40-50% 45-55%
25 30-40% 25-35% 55-65% 60-70%
50 55-65% 45-55% 70-78% 72-80%
100 72-82% 65-75% 82-88% 84-90%
200 82-90% 78-86% 86-92% 88-94%
500 88-93% 85-92% 90-95% 92-96%
1000 90-94% 88-94% 91-95% 93-97%
2000+ 91-95% 90-95% 92-96% 94-97%

주요 관찰: (1) 기초 모델 정렬 (Octo, OpenVLA) 은 미리 훈련된 시각적 및 행동적 전력이 제한된 작업 특정 데이터를 보완하는 낮은 디모 카운트 (10-100) 에서 가장 큰 장점을 제공합니다. (2) 500+의 디모에서, 처음부터 모델은 격차를 크게 좁히고, 기초 모델의 장점은 2-5 퍼센트 포인트로 좁혀집니다. (3) 모든 아키텍처는 배포 성능에 대한 500개의 디모를 넘어서서 수익률이 감소하는 것을 보여준다. 이는 다양성-대량 원칙을 강화한다. (4) ACT는 디포지션 정책보다 적은 디모를 통해 경쟁적인 성능을 달성하여 데이터 제한 팀들을 위한 더 좋은 선택으로 만든다.

팀 규모에 따라 실용적인 권고

확장된 증거는 여러분의 자원에 따라 구체적인 지침으로 번역됩니다.

** 단독 연구자 / 취미자 (예산: < 5,000 달러).** 기초 모델을 사용하십시오 (Octo). 하나의 작업에 대한 50-100 개의 시범을 수집하십시오. 성능을 최적화하기보다는 데이터 수집 파이프라인을 배우는 데 집중하십시오. 예상 결과는: 분배 조건에서 70-80%의 성공률, 30-40% OOD. 이것은 연구 프로토타입 또는 시범에 충분합니다. 하드웨어: OpenArm 1 (4,500 달러) 또는 RCSV를 통해 임대.

** 작은 연구 연구소 (예산: 10,000~50,000 달러).** 10-20 개체 및 2-3 환경에서 수집된 200-500 개의 시범을 통해 OpenVLA 또는 Octo를 정렬하십시오. 체계적인 평가 (제류된 객체, 유지된 위치) 에 투자하십시오. 예상 결과는: 85-92% 분배, 50-65% OOD. 이것은 제어된 환경에 배치 준비가되어 있습니다. RCSV의 [2,500달러의 파일럿]T5) 는 첫 200개의 디모를 다루고 있으며, [8,000달러의 캠페인]T6은 다양성 프로토콜을 가진 500개 이상의 디모를 다루고 있다.

** 스타트업/기업 (예산: 5만500만 달러/년) ** 연속적인 데이터 수집 인프라를 구축. 30개 이상의 객체 및 5개 이상의 환경에서 1,0005,000개의 시범을 작업당 수집. 자동화된 재교육 및 평가 파이프라인을 구현. 목표: 90-95% 분배, 70-80% OOD. 이 규모에서 데이터와 컴퓨팅 비용 비율은 예산의 약 90%의 데이터 수집과 10%의 컴퓨팅이 있어야 한다는 것을 의미합니다. 더 큰 모델보다는 수집 효율 (더 나은 텔레오퍼레이션 도구, 훈련된 운영자, 효율적인 QA) 에 투자하십시오.

** 대규모 기업 (예산: > $ 500,000/년).** 표준화된 프로토콜을 사용하여 다 사이트 수집을 설정하십시오. 독자적인 데이터 풀에 다 작업 기반 모델을 훈련하십시오. 각 배포 사이트는 데이터를 중앙 교육 파이프라인으로 공급합니다. 이 규모에서, 사이트 간 다양성은 주요 경쟁 우위를 만듭니다. 예상 결과: 95%+ 유통, 80%+ OOD 배포 환경. 기업 데이터 수집 파트너십을 위해 RCSV에 연락하십시오.

데이터와 스케일 모델의 대조

확장 증거에 기초한 실질적인 의사결정 프레임워크:

  • **분배에서 성공률이 85% 이하인 경우 규모의 데이터 (더 많은 시범) ** 교육에서 미흡한 특정 객체 위치나 방향에 대한 정책이 실패합니다. 작업은 여러 가지 실행 가능한 전략을 가지고 있으며 모드 붕괴를 목격하고 있습니다 (정책은 하나의 전략으로 konverges 그리고 그 전략이 적용되지 않을 때 실패합니다).
  • ** 규모 다양성 (더 많은 객체/환경) 에 대해:** 분배에서의 성공률은 85% 이상이지만 OOD 성능은 50% 이하입니다.
  • ** 규모 모델 (더 큰 건축물):** 당신은 풍부한 다양한 데이터를 (> 2,000 개의 시범이 10 개 이상의 객체 범주) 가지고 있으며 성능이 고조되었습니다. 당신의 작업은 복잡한 공간 관계 또는 긴 지평 계획에 대한 이해를 필요로합니다. 당신은 처음부터 훈련하는 대신 정렬 할 수있는 사전 훈련 된 기초 모델 무게에 액세스 할 수 있습니다.
  • **##############################################################################################################################################################################################################################################################################################################################################################################################

신체 간 확장: 얼마나 많은 로봇이 필요합니까?

오픈 X-Embodiment의 결과는 추가로 로봇 유형에서 데이터를 추가하면 목표 로봇에 대한 일반화를 향상시키는 것을 보여줍니다. 그러나 얼마나 많은 실시예들이 의미있는 이익을 제공합니까?

  • 1 실시예: 기본 기준. 단일 로봇 전문 정책.
  • 3-5 실시예: 가장 급격한 개선 영역. 3-5 개의 다른 로봇 유형 (다양한 운동학, 다른 지잡기) 의 데이터를 추가하면 목표 로봇에 대한 OOD 일반화를 15-25% 향상시킵니다.
  • 5-10 실시예: 계속적인 개선이지만 수익률이 감소한다.
  • 10+ 실시예: 각 실시예별 수반 개선은 작지만 (<2%), 누적 효과는 상당한다. 22 실시예들로 구성된 현재 OXE 데이터 세트는 교차 실시예별 훈련에 대한 강력한 기초를 제공합니다.

하나의 목표 로봇을 가진 팀들에 대해서는 실질적인 조언은 분명합니다. OXE 또는 DROID (OXE 또는 DROID) 에 미리 훈련된 기초 모델을 사용해서 (OXE 또는 DROID) 작업에 대한 데이터에 대해 정밀 조정하고, 5개 이상의 다양한 로봇 플랫폼에 액세스할 수 없는 한 처음부터 자신의 크로스 인체 데이터 세트를 구축하는 것은 비용 효율적이지 않습니다.

계산 예산 할당: 실용적인 틀

로봇 학습에서 데이터와 컴퓨팅의 극단적인 비용 비율을 고려하면 팀들은 데이터 수집, 컴퓨팅, 엔지니어링 시간 사이에 전체 예산을 분할하는 원칙적인 방법이 필요합니다. 확장 증거에 근거하여 프로젝트 단계별로 권장 할당하는 방법은 다음과 같습니다.

Project Phase Data Collection Compute (Training) Engineering / Evaluation Rationale
Prototype (0-50 demos) 40% 10% 50% Focus on pipeline setup; data collection validates hardware and workflow
Development (50-500 demos) 70% 10% 20% Maximize data diversity; compute costs are negligible relative to collection
Production (500-5000 demos) 60% 15% 25% Larger model fine-tuning justified; evaluation and deployment engineering critical
Scale (5000+ demos) 50% 20% 30% Continuous collection from deployments; multi-task training requires more compute

모든 단계에 걸쳐 일관된 메시지는: 데이터 수집은 예산에 지배한다. 어떤 단계에서도 계산은 전체의 20% 이상을 차지하지 않습니다. LLM 교육 직관에 따라 예산을 할당하는 팀은 체계적으로 데이터에 투자하지 못하고 로봇 학습 프로젝트에 대한 계산에 과도하게 투자합니다.

다양성 증제자: 다양성 데이터의 가치를 양자화하는 방법

확장 연구에서 가장 강력한 실무적 결과는 다양성 곱셈입니다. 같은 볼륨의 균일한 데이터에 비해 다양한 데이터에서 엄청난 성능 향상을 나타냅니다. 여기서는 실행 가능한 공식으로 소화 된 경험적 증거입니다.

표준 선택 및 장소 작업에 대해 다양성 점수를 정의하면: D = (특별 물체의 수) x (물체당 구별되는 위치의 수) x (빛 조건의 수) x (운영자의 수) 여러 작업의 RCSV 평가에서:

  • 200개의 D=200 (제물 10개, 위치 5개, 조명 2개, 운영자 2개) 로 이루어진 데모는 85%의 OOD 성공을 달성하였다.
  • D=20 (물질 1, 위치 5, 조명 2, 운영자 2) 를 가진 200개의 데모는 40%의 OOD 성공을 달성하였다.
  • D=20의 1000개의 디모는 55%의 OOD 성공률을 달성했습니다. 여전히 다양한 200개의 디모는 30점 아래로 떨어졌습니다.

이 결과는 극심하다: 200개의 다양한 시범은 분포 밖 일반화를 위한 1,000개의 균일한 시범보다 더 나은 성능을 발휘한다. RCSV의 수집 프로토콜은 부피 목표보다는 다양성 목표에 기반을 둔 이유다. 2,500 달러의 파일럿 패키지는 작업 사양 내에서 최대 다양성을 중심으로 설계된 200개의 시범을 수집한다. D>150의 200개의 디모를 대상으로 한 수집 캠페인은 D>50의 500개의 디모를 대상으로 한 캠페인을 보다 지속적으로 배포 가능한 정책을 만들어 낼 것입니다.

실패 모드 분석: 정책이 다른 수준에서 왜 평평하게 유지되는지

정책적 고원지대가 왜 문제인지 이해하려면 학습 파이프 라인의 어떤 구성 요소가 bottleneck인지 진단해야 합니다.

Plateau Signature In-Dist. Rate OOD Rate Root Cause Intervention
Low ceiling <70% <30% Data quality issue (inconsistent demonstrations, high noise) Audit and clean existing data; retrain operators; tighten QA gates
High in-dist, low OOD >90% <50% Diversity bottleneck (overfitting to training distribution) Add diverse environments and objects; use data augmentation; switch to foundation model
Mode collapse 70-85% 30-50% Architecture limitation (BC averaging over multimodal demonstrations) Switch from BC to Diffusion Policy or ACT; add action chunking
정밀도 failures 80-90% 60-75% Observation gap (task requires force/tactile data not in obs space) Add F/T sensor; add wrist camera for close-up view; use hybrid classical+learned control
Long-horizon decay 85-95% per step N/A Compounding error over 10+ steps Decompose into sub-policies; add hierarchical planning; use DAgger
Random failures 85-92% 70-80% Stochastic environment factors (object slip, lighting flicker) Add retry mechanisms; increase action frequency; use closed-loop control

진단 과정: 50개의 평가 에피소드를 실행하고, 각 실패를 분류하고, 실패가 특정 작업 단계 ( 접근, 포착, 운송, 배치) 에서 집합되었는지 또는 균일하게 분산되었는지 확인합니다. 집합된 실패는 목표 데이터에 의해 해결할 수 있는 특정 기술 격차를 나타냅니다. 균일하게 분산된 오류는 동일한 유형의 더 많은 데이터가 해결할 수 없는 시스템 문제 (데이터 품질, 아키텍처 불합동 또는 센서 제한) 를 나타냅니다.

실용적인 확장 실험 템플릿

대규모 데이터 수집 캠페인에 참여하기 전에 자신의 확장 곡선을 특징으로하고 싶은 팀들을 위해, 여기 RCSV가 클라이언트와 사용하는 실험 프로토콜입니다.

# Scaling experiment protocol
# Collect demos in batches, train and evaluate after each batch

import json
from pathlib import Path

def run_scaling_experiment(task_name, max_demos=500, batch_size=50):
    """
    Protocol:
    1. Collect batch_size demos
    2. Train policy on cumulative dataset
    3. Evaluate on fixed held-out test set (20 episodes)
    4. Log results and decide whether to continue
    """
    results = []
    cumulative_demos = 0

    for batch_idx in range(max_demos // batch_size):
        cumulative_demos += batch_size

        # Train on all demos collected so far
        model = train_policy(
            dataset_path=f"data/{task_name}",
            num_demos=cumulative_demos,
            architecture="act",  # or "diffusion_policy"
            epochs=2000,
        )

        # Evaluate on fixed test set (same 20 configs every time)
        in_dist_rate = evaluate(model, test_set="in_distribution", n=20)
        ood_rate = evaluate(model, test_set="out_of_distribution", n=20)

        results.append({
            "demos": cumulative_demos,
            "in_dist": in_dist_rate,
            "ood": ood_rate,
            "delta_in_dist": in_dist_rate - (results[-1]["in_dist"] if results else 0),
            "delta_ood": ood_rate - (results[-1]["ood"] if results else 0),
        })

        # Stop if both metrics have plateaued (<2% improvement for 2 batches)
        if len(results) >= 3:
            recent = results[-2:]
            if all(r["delta_in_dist"] < 0.02 for r in recent) and \
               all(r["delta_ood"] < 0.02 for r in recent):
                print(f"Plateau detected at {cumulative_demos} demos")
                break

    Path(f"results/{task_name}_scaling.json").write_text(json.dumps(results, indent=2))
    return results

이 프로토콜은 일반적으로 주어진 작업에 대한 대략적인 평판을 식별하기 위해 3-5개의 수집 훈련 평가 주기를 필요로 합니다 (150-250 개의 데모). 주요 출력들은: (1) 배포급 내 배포 성능의 최소 데모 수 (일반적으로 85-90%), (2) OOD 성능의 감소 점, (3) 병목은 데이터 부피, 데이터 다양성 또는 아키텍처 여부입니다. RCSV는 이 프로토콜을 2,500 달러의 파일럿 참여의 일환으로 운영하고 있으며, 클라이언트에게 완전한 수집 캠페인을 하기 전에 그들의 작업에 특화된 데이터 기반의 확장 곡선을 제공합니다.

다중 작업 규모: 작업 수치가 각 작업 데이터 요구에 어떻게 영향을 미치는지

최근 연구의 중요하고 상반되는 발견: 여러 작업에 대해 동시에 정책을 훈련시키는 것은 작업 당 데이터 요구 사항을 줄일 수 있습니다. 작업이 시각적 또는 운동 원시성을 공유 할 때 (모든 작업은 포착을 포함하고, 모두 같은 지지를 사용하며 모두 같은 테이블에 발생합니다), 작업 간의 공유 학습은 각각의 작업에 대한 데이터 효율성을 향상시키는 규칙화 효과를 제공합니다.

RCSV 다중 작업 훈련에서 얻은 경험적 관찰:

  • 1 작업, 200 개의 디모: 85% 배포 성공.
  • ** 5개의 관련 작업, 각각 200개의 디모 (1,000개의 전체):** 88%의 평균 분배 성공과 62%의 OOD. 3점의 분배 개선과 강력한 OOD 성능은 "무료"로 Cross-task transfer에서 얻는다.
  • ** 5개의 관련 작업, 각각 100개의 디모 (총 500개):** 84%의 평균 분배 성공과 55%의 OOD. 거의 200개의 디모가 단일 작업의 기본 기준과 작업 당 데이터의 절반과 일치한다.
  • ** 5개의 관련 없는 작업, 각각 200개의 디모 (1,000개의 전체):** 83%의 평균 분배 성공. 작업들은 유용한 원시적인 것을 공유하지 않기 때문에 단일 작업 훈련과 비교해 가벼운 저하.

엄지손가락 규칙: 작업이 동작 원시의 50% 이상을 공유하는 경우 ( 동일한 작업 공간, 동일한 지갑, 유사한 객체), 언어 조건화로 멀티 작업 훈련은 작업 당 데이터 요구 사항을 30-50% 감소시킵니다. 작업이 서로 관련이 없는 경우 (다양한 작업 공간, 다른 지갑), 개별 단일 작업 정책을 훈련하십시오. RCSV의 다중 작업 배포용 데이터 수집 캠페인은 독립된 단일 작업 캠페인과 비교하여 전체 수집 비용을 20-40% 감소시키는 Cross-task 공유 원시물을 극대화하도록 구성되어 있습니다.

컴퓨터 스케일링: 더 큰 모델을 훈련시키는 시간 vs 더 많은 데이터를 수집하는 시간

로봇 학습은 언어 모델링보다 다른 컴퓨팅 데이터 트레이드와 직면합니다. 언어 모델링에서 고정된 데이터로 모델 크기를 확장하면 성능이 예측 가능한 방식으로 향상됩니다. 로봇 학습에서, 증거는 대부분의 실용적인 작업에 데이터 다양성이 모델 크기에 비해 중요하다는 것을 암시합니다.

Model Size Architecture Example Demos for Peak In-Dist In-Dist Success OOD Success Training Cost
Small (5-20M params) ACT (ResNet-18 backbone) 200-300 85-92% 40-55% $5-15
Medium (50-200M params) ACT (DINOv2-B backbone) 300-500 88-94% 55-70% $50-200
Large (1-7B params) OpenVLA (Llama-7B backbone) 100-200 (fine-tune) 90-96% 65-80% $500-3,000

주요 발견: 다양한 데이터를 가진 중형 모델은 종종 OOD 평가에 대한 덜 다양한 데이터를 가진 큰 모델과 일치합니다. 500 가지 다양한 시범을 통해 훈련된 DINOv2 척추를 가진 100M 매개 변수 ACT는 150 가지 덜 다양한 시범에 정비된 7B 매개 변수 OpenVLA와 비교할 수 있는 65-70%의 OOD 성공을 달성 할 수 있습니다. 큰 모델은 더 높은 최고 분배 성능을 가지고 있지만 훈련 데이터의 다양성은 일반화의 지배적 요소입니다.

** 예산 배분 규칙:** 프로젝트 전체 예산이 X이라면, 데이터 수집 (다양성을 강조하는 것), 컴퓨팅 (훈련 및 평가) 에 20% 및 엔지니어링 (관광, 통합) 에 10%를 지출하십시오. 데이터 다양성을 희생하여 컴퓨팅에 과도하게 투자하는 팀은 지속적으로 다양한 데이터 수집을 우선시하는 팀보다 저가합니다.

시뮬레이션 데이터로 확장: 시밍이 얼마나 많은 실제 데이터를 대체할 수 있습니까?

시뮬레이션 데이터의 규모는 저렴하지만 전송은 미완전하다. 실제 데이터 수집은 얼마나 많은 것을 시뮬레이션으로 상쇄할 수 있는지에 대한 실질적인 질문입니다.

  • ** 시각 다양성:** Sim는 도메인 무작위화를 통해 무한한 시각 다양성을 제공할 수 있다. 특히 시각 일반화를 위해 (신작 객체, 조명, 배경) 도메인 무작위화를 가진 10K sim 에피소드는 500-1000 실제 에피소드에 동등한 이익을 제공합니다. 이것은 확장 컨텍스트에서 sim 데이터에 대한 가장 강력한 사용 사례입니다.
  • ** 엔진 제어 정확성:** 시미 데이터 전송은 정확성 작업 (미미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미 미
  • ** 실용적인 혼합 비율:** 가장 효과적인 접근법은 80-90%의 시밍 데이터 (비디오 다양성과 거친 행동) 과 10-20%의 실제 데이터 (물리학 지형 및 정확성) 이다. 이 하이브리드 접근법은 일반적으로 실제 데이터 수집 비용의 20-30%에서 전체 실제 데이터 성능의 85-90%에 도달한다.
  • **Sim에서 수익률이 감소한다:**Sim 데이터는 대부분의 작업에 10K-50K 에피소드에서 자신의 평판을 보여줍니다. 50K sim 에피소드 이외에도, 추가 sim 데이터는 무시무시한 개선을 제공합니다. 병목은 sim에서 실제 격차로 이동합니다. 데이터 부피가 아닙니다. 더 많은 에피소드보다는 더 나은 도메인 무작위로 투자하십시오.

RCSV는 [데이터 서비스] (T7) 를 통해 하이브리드 시프리얼 데이터 파이프라인을 지원합니다. 우리는 특정 작업에 대한 최적의 시프리얼 믹싱 비율에 대해 조언하고 실제 세계 정교 조정 데이터를 제공하여 시프리얼 믹싱 격차를 다치게 할 수 있습니다. 구현 세부 사항에 대해 [시프리얼 믹싱 가이드] (T8) 를 참조하십시오.

공개 된 질문 과 아직 알려지지 않은 것

로봇 학습 스케일링에 관한 몇 가지 중요한 질문은 2026년에 답이 남아있다. 연속적인 데이터 수집 (롤링 배포 + 주기적인 재교육) 은 오프라인 배팅 교육과 동일한 스케일링 곡선을 따르는지 여부는 명확하지 않습니다. 크로스 모달 데이터 (인간의 조작 비디오, 시뮬레이션 시범, 언어 설명) 는 실제 로봇 데이터와 같은 확장 혜택이 있는지 여부는 적극적으로 논의되고 있으며, 초기 증거는 시각적 표현에 도움이 된다고 하지만 정확한 모터 제어에는 도움이 되지 않는다고 제안합니다.

데이터 수집 속도는 얼마나 빨리 확장할 수 있습니까?

적절한 예산 배분에도 불구하고, 데이터 수집 속도는 물리적 현실에 의해 제한됩니다. 이러한 제약을 이해하는 것은 팀들이 현실적인 시간표를 설정하는 데 도움이 됩니다.

Configuration Demos/Hour Demos/Day (8hr) Time to 500 Demos
1 arm, simple pick-place, expert operator 60-120 400-800 1 day
1 arm, multi-step assembly, expert 15-30 100-200 3-5 days
Bimanual (ALOHA), simple task 30-60 200-400 2 days
Bimanual, complex task, novice operator 8-15 50-100 5-10 days
Remote teleop (100ms+ latency) 10-30 80-200 3-6 days

** 병렬화:** 데이터 수집을 확장하는 가장 빠른 방법은 여러 로봇 역을 동시에 실행하는 것입니다. 각 추가 역은 거의 선형 처리량을 증가시킵니다. (무인 10-15%의 조정 오버하스트). RCSV는 대규모 캠페인에서 4-8 개의 수집 역을 병렬적으로 운영하고 있으며, 간단한 작업에 대해 하루에 1,000-2,000+ 개의 데모를 달성합니다. 추가 역의 비용은 캠페인마다 부과되며, 병렬 수집은 단일 역을 더 오래 운영하는 것보다 더 비용 효율적입니다.

이 비율은 하드웨어 문제 없이 성숙한 수집 파이프라인을 가정합니다. 처음 설정에 대해, 운영자와 파이프라인을 디버깅하는 동안 첫 주 동안 처리량 기대를 50% 감소시킵니다. RCSV의 시설은 여러 작업 범주에서 500 시간 이상의 텔레 운영 경험을 가지고 있기 때문에 "전문적 운영자" 비율을 일관되게 달성합니다.

플라토 문제: 더 많은 데이터가 도움이 되지 않을 때

모든 팀은 결국 더 많은 시범을 추가하는 성능 평판을 달성합니다. 그 결과 가볍게 개선됩니다. 데이터 품질이나 다양성이 가장 중요한 요소가 될 때,

실반 고원점을 맞았다는 신호: 최근 3차례의 수집 훈련에서 성공률은 +/- 2% 내에 있었다. 체계적인 다양성 변이를 가진 200개의 더 많은 시범을 추가하면 OOD 성능이 향상되지 않았다. 검증 손실은 평평화되었고 더 많은 훈련 기간에 따라 감소하지 않는다.

다양성 고원시대와 대량 고원시대를 구별하는 것: 가장 흔한 오류는 다양성 고원시대를 대량 고원시대로 해석하는 것입니다. 당신이 타는 것을 테스트하기 위해: 최대 다양성을 가진 50개의 추가 시범을 수집하고 (새로운 물체, 새로운 위치, 새로운 조명) 기존 데이터와 같은 다양성 프로파일을 가진 50개의 추가 시범과 정책 개선을 비교하십시오. 다양한 배트가 성능을 향상시키고 균일 배트가 그렇지 않으면 다양성 문제가 있습니다. 둘 다 성능을 향상시키지 않으면 진정한 부피 평판을 달성했고 건축 변경 사항을 고려해야합니다.

판판이 인위적 (정비가능한) 일인 신호: 분배 성능은 강 (>90%) 하지만 OOD 성능은 약 (<50%) - 이것은 데이터 부피 부피 부피를 나타내는 것이 아니라 다양성 부채를 나타내는 것입니다. 실패는 특정 조건 (하나의 객체 유형, 하나의 작업 공간 지역) 에 집중됩니다 - 이러한 조건에서 목표형 데이터 수집은 도움이 될 것입니다. 정책은 모드 평균 (전략들 사이에 의 تردد) - 건축적 변경 (BC에서 방전 정책으로 전환) 또는 데이터 청소가 더 많은 데이터에 도움이 될 것을 보여줍니다.

실제 고원판에 도달하면 다음과 같은 옵션이 있습니다: (1) 초체육 사전 훈련이 있는 기초 모델로 전환하여 처음부터 고원판 위에 새로운 기준을 제공합니다; (2) 정책이 기존 관찰에서 추출할 수 없는 정보를 제공하는 모다리얼 (F/T 감지, 깊이) 을 추가하거나 (3) 과제를 부분 정책으로 분해하여 전체 과제 고원판을 넘어 독립적으로 개선 할 수 있습니다.

실용적인 체크포인트: 언제 데이터를 수집하는 것을 중단해야 하는가

팀들이 가장 자주 묻는 질문 중 하나는 "내가 얼마나 많은 시범을 필요로 하는가?"라는 것입니다. 정직한 대답은 당신의 임무와 목표 성공률에 달려 있습니다. 하지만 이러한 체크포인트들은 결정 포인트를 제공합니다.

  • 50 데모: 파이프라인 검증 체크포인트. 정책을 구성하고 20개의 실험을 평가하십시오. 성공률이 30% 이하인 경우, 데이터 볼륨 문제보다는 파이프라인 버그 (데이터 형식, 액션 정상화, 카메라 캘리브레이션) 가 발생할 가능성이 높습니다. 더 많은 데이터를 수집하기 전에 파이프라인을 수정하십시오.
  • ** 100 데모:** 가능성 검증점. 정책이 50%+의 분배 성공을 달성한다면, 작업은 현재 아키텍처와 데이터 품질에 따라 학습할 수 있습니다. 디버깅 후 50% 이하의 경우, 작업이 추가적인 모다리 (F/T 감지, 깊이) 또는 다른 알고리즘이 필요한지 고려하십시오.
  • ** 200 개의 디모:** 다양성 검증점. 보유된 객체/지위에 대한 평가. 유통 성공률이 80%+이고 OOD 성공률이 40% 이하인 경우, 문제는 다양성입니다.
  • 500 데모: 복귀 점검점 감소. L2 작업에 대한 단일 작업 BC에 대해서는 대부분의 팀은 300-500 데모에서 3% 미만의 향상을 볼 수 있습니다. 500 데모에 의해 목표 성공률을 달성하지 못한다면, 병목은 데이터 부피보다는 건축적일 가능성이 높습니다.
  • 1,000+ 데모: L3/L4 작업 (복합 집합, 다단계 순서) 또는 다단계 훈련에만 정당화되어 전체 데모 수치는 5-10 작업으로 나뉘어 있습니다.

아마도 가장 중요한 것은: 50,000개의 시범시험에 있는 DROID 고원시대는 현재 건축물들에 대한 근본적인 천장을 반영하고 있는지, 테스트된 특정 모델의 한계 (ACT, 방산 정책) 또는 데이터 세트의 다양성 프로파일의 유물물인지 알 수 없습니다. 더 큰 다양성으로 이루어진 데이터 세트는 이 고원시대를 더 높게 밀어 넣을 수 있습니다. 대체로, 건축 혁신 (더 나은 행동 표현, 향상된 시간 모델링 또는 더 효과적인 힘-토크 데이터 사용) 은 현재의 확장 천장을 통과하는 데 필요한 것일 수 있습니다.

RCSV [데이터 플랫폼] (T9) 는 이러한 불확실성을 탐색하는 팀들을 지원하기 위해 설계되었습니다. 우리의 구조화된 다양성 프로토콜, 표준화된 평가 벤치마크 및 유연한 데이터 수출 형식은 확장 동적에 대한 분야의 이해가 계속 진화함에 따라 빠르게 반복 할 수 있습니다.

관련 독서

  • [오픈 X-체체: 모든 것을 변화시킨 로봇 데이터 세트]
  • [전반화 도전: 왜 로봇 정책이 여전히 실패하는 것 2026]
  • [로봇 학습: 시범 분석당 비용]
  • [비디오에서 로봇 학습: 2026년 최첨단 기술]
  • [행동과 방전 정책: 언제 사용해야 하는 것]
  • [RCSV 데이터 수집 서비스]

다양하고 고품질의 데이터 세트를 구축

RCSV 데이터 수집 서비스는 다양성을 극대화하기 위해 구성되어 있습니다. 실제로 로봇 정책 성과를 확장하는 차원입니다.

[데이터 서비스를 탐구]