로봇 훈련 데이터 는 무엇 입니까? 종류, 수집 방법 및 품질 표준
로봇 훈련 데이터는 물리적인 인공지능의 병목입니다. 로봇 데이터의 종류, 수집 방법의 비교, 중요한 품질 표준, 그리고 팀들이 저지르는 일반적인 실수를 알아보세요.
큰 언어 모델들은 인터넷을 가지고 있었습니다. 자율주행 자동차는 수백만 마일의 기록된 운전을 했습니다. 물리적인 인공지능 (AI) -- 물체를 조작하고 제품을 조립하고 인간과 함께 일하는 로봇 -- 데이터 문제입니다. 로봇 훈련 데이터는 동시에 전체 파이프라인에서 가장 중요한 입력과 가장 어려운 병목입니다. 이 가이드에서는 로봇 훈련 데이터가 실제로 무엇인지, 존재하는 유형, 팀들이 어떻게 수집하는지, 그리고 몇 달의 엔지니어링 노력을 낭비하는 데이터 세트에서 신뢰할 수 있는 정책을 생성하는 품질 표준을 분해합니다.
로봇 훈련 데이터를 정의
로봇 훈련 데이터는 로봇이 작업을 수행하는 기록된 에피소드들로 구성됩니다. 각 에피소드는 카메라 이미지 (RGB 및 깊이), 관절 위치 및 속도, 최종 효과자 포지, 지잡기 상태, 동전력 판독 및 이러한 움직임을 생성하는 제어 입력 데이터를 동기화하는 센서 데이터 스트림을 캡처합니다. 에피소드는 일반적으로 10~60초 동안 지속되며 하나의 작업을 수행하는 완전한 시도를 나타냅니다. 물체를 찾아내고, 그것을 잡으며, 목표 위치에 이동하고, 그것을 풀어줍니다.
이 데이터는 [이미테이션 학습] (
로봇 훈련 데이터는 이렇게 bottleneck이 되는 이유는 인터넷에서 스크래프할 수 없기 때문입니다. 모든 에피소드는 숙련된 인간 운영자 또는 신중하게 스크립트 된 컨트롤러를 통해 물리적 환경에서 실행되는 물리적 하드웨어를 필요로 합니다. 수집률은 초당 에피소드, 초당 에피소드로 측정됩니다. 일반적인 연구 데이터 세트는 100~10,000개의 에피소드를 포함합니다. 언어나 시각 모델을 작동시키는 데이터 세트보다 규모가 작은 순서입니다.
로봇 훈련 데이터의 종류
** 시범 데이터**는 가장 흔한 유형이다. 인간 운영자는 로봇을 원격 조작이나 운동학습을 통해 제어하고, 로봇은 센서 스트림과 그 결과의 행동을 기록한다. 시범 데이터는 직접적으로 관찰에서 정책이 배워야 할 행동까지 지도를 캡처합니다. 모방 학습의 금 표준이며 대부분의 데이터 수집 프로그램의 주요 출력입니다.
** 상호작용 데이터**는 로봇이 자율적으로 정책을 실행하고 결과를 기록하는 것을 캡처합니다. 이 데이터는 성공과 실패 모두 포함되며 온라인 강화 학습, DAgger 스타일의 반복적 개선 및 실패 모드를 식별하는 데 사용됩니다. 상호작용 데이터는 일반적으로 에피소드별 시범 데이터보다 품질이 낮지만 지속적인 인간의 관심을 필요로 하지 않기 때문에 더 큰 양으로 수집될 수 있습니다.
** 합성 데이터는** 완전히 시뮬레이션으로 생성됩니다. NVIDIA 아이작 시ム, MuJoCo, 제네시스 같은 물리 엔진은 시뮬레이션 로봇이 작업을 수행하는 가상 환경을 렌더링합니다. 합성 데이터는 무한한 부피와 완벽한 해설을 제공하지만 [sim-to-real gap] (T2
** 비디오 데이터는 인간의 기록된 활동에서 나온다. 요리 비디오, 집합 지침, 조작 시범 - 로봇이 없는 채 촬영된 것입니다. 비디오 데이터는 인터넷에서 풍부하지만 행동 레이블이 없습니다. 그것은 로봇 정책을 직접 훈련하는 것보다 [예술 전에 시각적 표현]
데이터 품질 차원은 사용 가능한 데이터를 소음으로부터 분리하는 요소입니다
모든 시범은 평등하게 만들어지지 않습니다. RCSV에서 수십 개의 데이터 수집 캠페인과 함께 작업한 후, 우리는 데이터 세트가 배포 가능한 정책을 훈련시키거나 몇 달의 엔지니어링 노력을 낭비하는지 예측하는 측정 가능한 6 가지 품질 차원을 확인했습니다.
1· 시범적 일관성
일관성은 동일한 조건에서 동일한 작업의 시범을 통해 행동 궤도가 얼마나 비슷하는지 측정합니다. 수학적으로, 당신은 한 조건에서 모든 에피소드 쌍의 최종 효과자 궤도 사이의 동적 시간 왜곡 (DTW) 거리를 계산하여 변수의 계수를 살펴봄으로써 이것을 수치화 할 수 있습니다. 기량 측정 작업에 대한 운영자 중 0.15 이하의 CV는 좋은 일관성을 나타냅니다. 0.30 이상의 신호는 정책에 혼란을 초래할 프로토콜 파동입니다.
부합성은 두 가지 원천에서 발생합니다. 운영자 기술 변동과 모호한 작업 정의. RCSV는 주간 캘리브레이션 세션으로 구조화된 [운영자 교육 프로그램] (
2. 실패 모드의 커버링
깨끗하고 성공적인 시범을 포함하는 데이터 세트는 거의 실패 상태가 없었던 정책을 생성하고 그 중에서도 복구할 수 없습니다. 가장 좋은 데이터 세트는 복구 시범의 통제 된 비율을 포함합니다. 운영자는 의도적으로 약간 잘못된 자세에서 시작하거나 객체를 떨어뜨리고 다시 잡거나 작업 중 잘못된 조화를 수정합니다. 회복 시범에 대한 순수한 성공의 90/10 분배는 좋은 시작 비율입니다. 훈련 중에 별도로 중화될 수 있도록 메타데이터로 복구 에피소드를 태그하십시오.
또한 실제 실패를 기록하고 태그하는 것도 중요합니다. 500개의 성공과 100개의 태그 실패의 데이터 세트는 600개의 성공보다 더 가치 있습니다. 왜냐하면 실패 에피소드는 바이너리 성공 분류자를 훈련시키고 작업 분포의 경계를 정의하고, 모순적인 학습 접근방법의 부정적인 예를 제공할 수 있기 때문입니다.
3· 업무 분포 범위
작업 분포는 정책이 배포할 때 발생할 모든 시작 조건, 객체 구성 및 환경 변이의 공간입니다. 데이터 세트는 이 공간을 사시적으로 샘플링하지 않으면 안 됩니다. 수집 전에 변수의 축을 명시적으로 정의합니다.
| Variation Axis | Minimum Coverage | Example Values |
|---|---|---|
| Object instances | 10+ per category | 10 different mugs, 12 different cans |
| Starting positions | Full workspace coverage | 5x5 grid across 40cm x 40cm workspace |
| Object orientations | 4+ orientations per object | 0, 90, 180, 270 degrees; upright and on side |
| Lighting conditions | 3+ conditions | Overhead fluorescent, side lamp, natural daylight |
| Background scenes | 3+ backgrounds | Clean table, cluttered workspace, different table color |
| Operators | 3+ operators | Distinct control styles, response speeds |
| Distractor objects | Present in 30%+ of episodes | Non-target objects in workspace |
전체 에피소드 수는 커버링 요구 사항에서 따른다. 만약 당신이 독특한 조건에 따라 10 에피소드가 필요하고 10 개 x 5 위치 x 3 조명 조건이 있다면, 최소한의 데이터 세트 크기는 1,500 에피소드입니다. 이것은 천장이 아니라 바닥입니다.
4· 시간적 질
시범시행 중에 운영자 의 의 의박, 중단 및 반전 은 행동 분포 에 소음을 도입 한다. 선택 및 장소 작업을 수행 하는 숙련된 운영자 는 원활 한 8 초 궤도를 생성 한다. 동일한 작업을 수행 하는 초보 운영자 는 3-4 번의 중단과 방향 반전으로 25 초 궤도를 생성 할 수 있다. 초보 시범은 느린 것뿐만 아니라 정책에 일시 중지 및 역행법을 가르칩니다. 이는 드물게 바람직한 행동입니다. 시간적 품질 필터링은 작업의 평균 기간의 2배를 넘는 전체 기간이있는 시범을 제거합니다. 또는 속도 프로파일은 특징적인 주저 패턴을 보여줍니다.
5. 센서 동기화 품질
멀티 카메라 설정 및 혼합 센서 스트림 (카메라 + 관절 상태 + 힘 / 토크) 은 엄격한 용납 범위 내에서 동기화되어야합니다. 30Hz 이미지 스트림에서, 단일 떨어지는 프레임조차도 관찰과 행동의 잘못된 조화를 일으키는 33ms 격차를 만듭니다. 1kHz로 기록된 힘토크 데이터에 대해서는 F/T 센서와 카메라 드라이버 사이의 시계 파동이 60초의 에피소드 동안 수백 밀리초에 축적될 수 있다. RCSV의 수집 파이프라인은 하드웨어 트리거드 동기화 (Intel RealSense 하드웨어 동기화) 를 사용하여 각 녹음 세션 끝에서 인터 스트림 타이밍을 검증한다. 10ms를 초과하는 동기화 오류가 있는 에피소드는 재 수집을 위해 표시됩니다.
6. 액션 스페이스 충실성
기록된 동작은 컨트롤러가 명령한 것이 아니라 로봇이 실제로 한 일을 충실히 표현해야 한다. 리더-따라자 텔레오퍼레이션 시스템에서는 후속 팔이 리더를 20~50ms로 뒤쳐서 공동 제한, 토크 제한 또는 역동적 응답으로 인해 리더의 궤도를 완벽하게 추적하지 않을 수 있다. 실행된 동작 (따라자로부터) 보다 명령된 동작 (지도자로부터) 을 기록하는 것은 체계적인 편향을 도입한다. 항상 추종자의 실제 공동 상태와 최종 효과자 포즈를 행동 레이블로 기록하고 지도자의 명령이 아니다.
규모 를 측정 하는 법: 실제 로 얼마나 많은 시범 을 필요로 합니까?
데이터 세트 크기와 정책 성과 사이의 관계는 예측 가능한 패턴을 따르지만 정확한 숫자는 작업 복잡성, 정책 구조 및 데이터 품질에 달려 있습니다. 발표된 결과와 RCSV의 내부 벤치마크에 따라 다음과 같은 실용적인 지침이 있습니다.
| Task Complexity | Example | Demos for 70% Success | Demos for 90% Success | Policy Architecture |
|---|---|---|---|---|
| Simple pick-place (1 object) | Pick block, place in bin | 30-50 | 100-200 | ACT |
| Multi-object pick-place | Sort 5 objects into bins | 150-300 | 500-1,000 | Diffusion Policy |
| Contact-rich single task | Peg insertion, lid closing | 100-200 | 300-500 | Diffusion Policy + F/T |
| Bimanual coordination | Fold towel, open bag | 200-400 | 800-1,500 | ACT (bimanual) |
| Language-conditioned multi-task | "Pick the red cup," "stack blocks" | 500-1,000 per task | 2,000-5,000 per task | VLA (OpenVLA, RT-2) |
| VLA fine-tuning (pre-trained) | Adapt OpenVLA to new task | 50-100 | 200-500 | OpenVLA + LoRA |
최근 스케일링 연구로부터 중요한 통찰력: 다양성 일정으로 유지되는 동안 데이터 세트의 크기를 두 배로 늘리는 것은 첫 200-300 에피소드 후 감소하는 수익을 창출합니다. 이 때문에 RCSV의 [데이터 수집 프로토콜]
데이터 플라이휠: 수집 에서 지속적인 개선
가장 진보된 팀은 데이터 수집을 일회적인 이벤트로 취급하지 않습니다. 그들은 데이터 플라이휠을 구축합니다. 배치된 정책이 새로운 상호작용 데이터를 생성하고, 데이터를 검토하고 해설하고, 다음 훈련 반복에 다시 공급합니다. 플라이휠은 네 단계가 있습니다.
단계 1: 씨 데이터 세트를* 200~500개의 고품질의 시범을 텔레오퍼레이션으로 수집하고 초기 정책을 훈련시킵니다. 이것은 최소한의 실행 가능한 데이터 세트입니다.
단계 2: 로그링을 통해 배치. 전체 센서 로그링을 활성화한 상태에서 실제 작업에 대한 초기 정책을 구현합니다. 실패를 포함한 모든 자율 실행이 기록됩니다. 인간 운영자는 정책이 실패했을 때 모니터링하고 개입합니다 (DAgger 스타일의 수정).
** 3단계: 실패를 대상으로 한 수집.** 체계적인 실패 모드를 식별하기 위해 기록된 배포 데이터를 분석하십시오. 해당 실패 조건을 특별히 목표로 하는 추가 시범을 수집하십시오. 만약 정책이 어두운 색의 객체에서 실패한다면, 어두운 객체로 50 시범을 수집하십시오. 목표가 작업 공간의 가장자리에있을 때 실패하면, 가장자리에 있는 50 시범을 수집하십시오. 이 목표 집합은 균일 데이터 증강보다 5-10배 더 효율적입니다.
** 4 단계: 재훈련 및 반복.*** 목표 데이터와 원래 데이터 세트를 통합하고 재훈련하고 재배포한다. 플라이휠을 통한 각 회기는 가장 약한 성능 영역에서 측정 가능한 개선을 가져온다. 플라이휠 반복 35번을 실행하는 팀은 일반적으로 큰 초기 데이터 세트에 한 번 훈련을 하는 팀보다 1525% 더 높은 성공률을 달성한다.
데이터 플라이휠을 구축하는 데는 지속적인 로그링, 자동 오류 검출 및 빠른 재교육을 위한 인프라가 필요합니다. RCSV의 [데이터 플랫폼]
수집 방법 을 비교 해 보
** 텔레오퍼레이션**은 고품질의 조작 데이터 수집의 지배적인 방법이다. 운영자는 리더-포고 세팅, VR 컨트롤러, 우주 마우스 또는 데이터 장갑을 사용하여 로봇을 원격으로 제어한다. 로봇은 모든 센서 스트림을 기록하면서 실시간으로 운영자의 명령을 실행한다. 원격 조작은 자연적이고 유동적인 시범을 생산하고, 이는 운영자가 자신의 전략을 실시간으로 각 상황에 맞게 조정할 수 있기 때문에 잘 일반화됩니다. 작업 복잡성과 재설정 시간에 따라 시간당 30~120개의 에피소드를 수집하는 비율이 다양합니다. 주요 단점은 운영자의 피로입니다. 장기 세션 후에 품질이 악화되고 운영자는 훈련이 필요합니다.
키네스텍 교육은 로봇이 컴플라이언스 (중력 보상) 모드 에 있는 동안 원하는 동작을 통해 로봇 팔을 물리적으로 안내하는 것을 포함한다. 운영자는 최종 효과자나 손잡이를 잡고 작업 궤도를 통해 이동합니다. 이 방법은 직관적이며 외부 제어 하드웨어가 필요하지 않지만 상당한 한계를 가지고 있습니다. 운영자의 손이 카메라 관점으로부터 작업 공간을 차지하고, 운영자가 로봇의 관동성을 싸우는 것이기 때문에 힘의 적용은 자연스럽지 않으며, 방법은 쌍방향 또는 모바일 조작 작업에 확장되지 않습니다. 운동학 교육은 단순한 단일 팔의 픽업 및 위치 작업에 가장 잘 작동합니다.
** 스크립트 수집**는 미리 정의된 운동 원시 (approach waypoints, grapple patterns, placement sequences) 를 사용하여 무작위로 실행된다. 스크립트 수집은 높은 양의 데이터를 생성할 수 있습니다. 자동으로 리셋을 통해 시간당 수백 개의 에피소드) 하지만 운동 전략이 고정되어 있기 때문에 낮은 다양성을 보여주는 시범을 생성합니다. 스크립트 데이터는 잘 구조화된 작업에 대한 정책을 초기화하는데 유용하지만, 알려진 객체와 함께 빈을 선택하는 것과 같은 정책에 유용하지만, 새로운 상황으로 일반화되는 경우는 거의 없습니다. 대부분의 생산 데이터 세트는 작업의 구조화된 부분들을 위해 스크립트 수집을 사용하고 접촉 부적하거나 구조화되지 않은 부분들을 위해 원전 작업을 합니다.
** 비디오 모방**은 손 추적, 포즈 추정 및 로봇 운동학으로 재목표를 사용하여 녹음된 인간 비디오에서 시범을 추출합니다. 이 접근법은 여전히 대부분 실험적입니다. 거친 팔 움직임에 대해 합리적으로 잘 작동하지만 손 포즈 추정이 충분히 정확하지 않기 때문에 미세한 조작에 실패합니다. 인간에서 로봇의 실시예 지도는 오류를 도입합니다. 비디오 모방을 탐구하는 팀은 이를 로봇이 모방하는 데이터 수집에 보완하는 것으로 간주해야 하며 대체하는 것이 아닙니다.
수집 방법 비교 테이블
| Method | Throughput | Data Quality | Hardware Cost | Best For |
|---|---|---|---|---|
| Leader-follower teleop | 5-12 demos/hr (expert) | Highest | $4,500-32,000 | Dexterous, contact-rich tasks |
| VR controller teleop | 8-15 demos/hr | High | $500-1,500 | Pick-place, general manipulation |
| Kinesthetic teaching | 3-8 demos/hr | Medium | $0 (uses robot) | Simple trajectories, prototyping |
| Scripted + randomized | 60-200 demos/hr | Low-medium | $0 (software) | Structured tasks, pre-training |
| Video retargeting | N/A (post-hoc) | Low | $0-500 | Visual pre-training only |
사실 중요 한 품질 요인
** 다양성**은 가장 중요한 단일 품질 요인이다. 15 개의 객체 인스턴스, 3 개의 조명 조건 및 3 개의 운영자를 포함하는 200 개의 에피소드 데이터 세트는 거의 항상 균일한 조건에서 하나의 객체와 함께 2,000 에피소드보다 더 나은 정책을 만들어 낼 것입니다. 다양성은 특정 시각 패턴을 기억하는 대신 작업 개념을 배우도록 정책을 강요합니다. 최소한 강력한 조작 데이터 세트는 한 카테고리당 10 개 이상의 별개의 객체 인스턴스, 3 개 이상의 조명 조건, 전체 작업 공간에서 다양한 시작 위치 및 여러 운영체제를 포함해야 합니다.
일관성은 성공 기준, 재설정 절차, 과제 정의가 모든 에피소드에서 동일하다는 것을 의미합니다. 일부 에피소드에서는 거의 실패가 성공적이라고 생각하지만 다른 에피소드에서는 정확한 배치가 필요하다면 정책은 모호한 목표를 알게됩니다. 일관성은 기록적인 수집 프로토콜, 운영자가 명확하게 적용할 수 있는 명확한 성공 기준 및 에피소드 간 표준화된 리셋 절차를 요구합니다.
설명 정확성은 각 에피소드에 첨부된 메타데이터를 포함합니다. 성공/실패 레이블, 언어 명령 레이블, 작업 단계 세그먼트 및 객체 아이덴티티 태그. 잘못된 해설은 훈련 신호를 손상시킵니다. 바이너리 성공 레이블은 경계 사례에 대한 두 번째 검토자가 확인해야합니다. 언어 명령은 실제 작업 행동에 대한 검증이 필요합니다. RCSV의 파이프라인에는 모든 국경 사례에 대한 인간 검토와 함께 자동화된 성공 분류가 포함되어 있습니다.
** 에피소드 완성**는 모든 에피소드가 초기 접근에서 최종 배치까지 전체 작업을 캡처하는 것을 의미합니다. 모든 센서 스트림이 동기화되어 프레임이 떨어지지 않습니다. 완전하지 않은 에피소드는 - 녹화가 중간 지점에서 시작되었거나 카메라 스트림이 떨어졌거나 이미지보다 다른 주파수에서 공동 상태가 기록되었거나 - 정책 학습을 악화시키는 소음을 도입합니다. 동기화 검증은 모든 수집 파이프라인에서 자동화된 단계가 되어야 합니다.
팀들이 첫 번째 데이터 세트를 수집하는 데 자주 저지르는 실수
** 너무 많은 에피소드를 수집하고 너무 적은 다양성.** 팀들은 종종 에피소드 수를 목표로 (1,000 에피소드) 에 집중하고 다양성을 통제하지 않고 있습니다. 그 결과, 큰 데이터 세트가 너무 많이 넘는다. 우선 다양성 목표를 설정하세요. 객체 인스턴스, 환경, 운영자 수. 그리고 전체 에피소드 수를 조건별 최소로 곱한 목표에서 따를 수 있도록 하세요.
Skip operators calibration. 훈련되지 않은 운영자들은 정책 성능에 적극적으로 해를 끼치는 비관적, 비관적 인 시범을 만들어냅니다. 새로운 운영자마다 시범이 데이터 세트에 대한 계산 전에 텔레 운영 인터페이스를 연습하기 위해 2-4 시간을 할애하십시오. 운영자별 품질 매트릭을 추적하고 피드백을 제공합니다.
**실패 에피소드를 기록하지 않습니다.**실패 시범은 기록되고 태그되어 버려지지 않아야 합니다.실패 데이터는 복구 행동 훈련, 임박한 실패를 감지하기 위한 분류자를 구축하는 데 유용하며, 작업이 가장 어려운 곳을 이해하는 데 유용합니다.
** 리셋 일관성을 무시.** 에피소드 사이의 리셋이 방편하다면 - 대략 같은 장소에 배치된 객체, 이전 실험에서 남겨진 배경 오차 - 데이터 세트는 체계적인 편향을 물려받습니다. 정의된 영역 내에서 무작위로 객체 배치, 일관된 배경 상태, 그리고 에피소드 사이에 운영자가 따르는 체크리스트를 포함한 반복 가능한 리셋 프로토콜에 투자하십시오.
** 잘못된 형식을 선택.** 사용자 정의 형식에서 데이터를 저장하는 것은 모든 하류 소비자에게 마찰을 초래합니다. 기존의 형식을 사용하십시오: HDF5 또는 Zarr는 원료 에피소드 데이터, 공유를 위한 [LeRobot HuggingFace 형식]
** 해설에 투자하지 않는 경우.** 많은 팀들은 언어 해설을 완전히 생략하거나 동일한 지침을 복사하여 붙인 에피소드를 라벨링합니다. 언어 조건 정책을 훈련하거나 VLA를 정비할 계획이라면, 모든 에피소드는 무슨 일이 일어났는지 정확하게 설명하는 독특한 자연어 지침이 필요합니다. " 테이블의 왼쪽에서 빨간 잔을 가져와서 파란색 판에 올려 놓"는 유용한 해설이다. " 선택하고 배치"는 그렇지 않습니다. 자세한 표준을 위해 [해설 지침]
데이터 형식 및 수출 표준
올바른 저장 형식을 선택하는 것은 파이프라인의 모든 하류 단계에 영향을 미칩니다. 여기서는 당신이 만날 수 있는 형식의 실제 비교가 있습니다.
| Format | Strengths | Weaknesses | Best Use Case |
|---|---|---|---|
| HDF5 (.h5) | Random access, chunked compression, metadata support, mature tooling | Single-writer lock, poor cloud streaming, no built-in versioning | Local collection, ACT/Diffusion Policy training |
| Zarr | Cloud-native, concurrent writes, chunk-level access, S3/GCS compatible | Less mature ecosystem, no single-file portability | Large-scale cloud datasets, Diffusion Policy reference implementation |
| RLDS (TFRecord) | Streaming, Open X-Embodiment standard, TF ecosystem integration | TensorFlow dependency, no random access, sequential read only | Cross-embodiment sharing, OXE compatibility |
| LeRobot (HuggingFace) | Standardized schema, Hub integration, streaming via datasets library, growing community | Parquet overhead for small datasets, Hub dependency for sharing | Community sharing, LeRobot framework training, VLA fine-tuning |
| ROS bag (.bag / .db3) | Native ROS logging, preserves topic structure, replay support | ROS dependency, not ML-ready, needs conversion for training | Raw collection on ROS2 systems, debug replay |
RCSV의 권고: 수집 단계 동안 최대 유연성을 위해 HDF5 또는 ROS 가방에서 수집하고, 공유 및 훈련을 위해 LeRobot 형식으로 변환합니다. 우리의 [데이터 플랫폼]
정책 유형별 인노테이션 요구 사항
다른 정책 구조는 각기 다른 해설 계층을 요구합니다. 폐기물을 미흡한 해설은 미래의 기회입니다. 폐기물을 과잉 해설하는 것은 현재 예산입니다.
ACT / 방전 정책 (일 작업): 에피소드 당 바이너리 성공 플래그. 선택적: 디버깅을 위한 작업 단계 세그먼트. 언어 레이블이 필요하지 않습니다. 해설 비용은: 에피소드 당 0.02-0.05 달러.
** 언어 조건 BC (BC-Z, RT-1):** 이진 성공 플래그 + 에피소드 당 자연어 명령. 명령은 작업 변형을 구별해야합니다. 해설 비용은: 에피소드 당 $0.10-0.25
VLA 정렬 (OpenVLA, RT-2): 바이너리 성공 플래그, 자연어 명령어, 이상적으로는 작업 단계 세그먼트. 언어 명령어는 모형 언어 일반화를 가르치기 위해 문장 (복본- 붙여진 것이 아니라) 에서 다양해야합니다. 해설 비용은: 에피소드 당 $0.25-0.50
** 순위적 정책:** 하위 작업 성공 플래그를 가진 완전한 작업 단계 세그먼트. 각 단계 경계에는 시간표 레이블이 필요합니다. 해설 비용은: 작업 복잡성에 따라 에피소드당 0.50-2.00 달러.
상세한 해설 지침과 도구 추천을 위해 [로봇 데이터 해설 지침]를 참조하십시오.
RCSV 데이터 서비스 시작
로봇 훈련 데이터 프로그램을 처음부터 구축하는 것은 하드웨어, 운영자, 실험실 환경, 수집 소프트웨어, 품질 보장 도구 및 데이터 엔지니어링 전문 지식이 필요합니다. 이 인프라를 구축할 수 있는 것보다 더 빨리 데이터를 필요로 하는 팀들을 위해 RCSV의 [데이터 서비스] (
가장 빠른 방법은 작업 설명, 목표 로봇 플랫폼 및 원하는 에피소드 수를 제공하여 데이터 서비스 팀에 연락하는 것입니다. RCSV는 수집 프로토콜 설계, 운영자 훈련, 데이터 수집, 품질 보장, 해설 및 선호하는 형식으로 수출을 처리합니다. RCSV 임대 하드웨어를 사용하여 시설에서 원격 수집은 또한 특정 환경이나 객체를 필요로 하는 작업에 지원됩니다.
첫 번째 데이터 수집 캠페인을 계획하고 있다면, 수천개로 확장하기 전에 작업 정의와 품질 표준을 검증하기 위해 200-500개의 에피소드를 가진 파일럿으로 시작하십시오. 이 파일럿 접근법은 결함있는 프로세스에 몇 주간의 수집 시간을 투자한 후에 아니라, 수정 할 수있는 값이 저렴할 때 프로토콜 문제를 일찍 파악합니다. RCSV의 파일럿 프로그램은 2,500 달러에서 시작되며 프로토콜 설계, 200 개의 시범, 품질 보고 및 선택된 형식으로 수출을 포함합니다. 생산 데이터 세트 전체 캠페인은 8,000 달러에서 시작되며 부피와 함께 확장됩니다.
하드웨어 옵션은 [OpenArm 1] (
관련 독서
- 로봇 데이터 해상 설명서 - 훈련에 대한 시범을 어떻게 표시해야 하는가
- 스케이링 로봇 데이터 수집 팀 -- 1K에서 100K까지의 시범
- 데이터 수집을 위한 로봇 카메라 설정 -- 손목, 상부 및 스테레오 구성
- 로봇 학습의 분포 정책 -- 데이터 요구 사항 및 교육 설정
- VLA 모델 설명 - 시범 데이터와 정교한 조율
- [원격조작 Data Beats Simulation] (T22
) - 실제 세계 수집의 사례 - RCSV 데이터 서비스 -- 2,500 달러에서 관리된 데이터 수집
- 공공 데이터 세트 -- 기존 로봇 데이터 세트를 탐색하세요
- 로봇 리싱 -- 회수 하드웨어에 매달 액세스







