로봇 데이터 수집: ML 팀에 대한 완전한 가이드
고품질의 로봇 훈련 데이터를 수집하는 방법 <unk> 원격 조작 방법, 에피소드 요구 사항, 데이터 형식 및 50에서 10,000+ 시범 시범까지 확장하는 방법
[← 가이드]
고품질의 로봇 시범 데이터를 수집하는 최종 플레이북
실제 로봇 데이터 는 시뮬레이션 을 왜 이겨야 하는가
학습된 로봇 조작 정책을 도입하는 데 가장 큰 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한 가지 단 한
시프 로 리얼 인 격차 는 충분히 빨리 지 못하고 있습니다
물체 가 변형, 미끄러지며, 가장 좋은 물리학 엔진 이라도 거의 비슷 하지 않는 방식으로 상호 작용 합니다. 시뮬레이션 된 천체는 실제 면 도깨기와는 전혀 다르지 않습니다. 시뮬레이션 된 카드본 상자는 옆 압력 아래 실제 상자와 같은 방식으로
2025년, 구글 딥마인드의 RT-2는 13만 개의 실제 세계 시범을 통해 새로운 객체 조작에 62%의 성공을 거두었습니다. 토요타 연구소의 퍼포먼스 정책은 훈련된 작업에서 단지 200 개의 시범으로 94%의 성공을 거두었지만, 이러한 시범은 높은 품질, 일관성, 그리고 배포에 사용되는 정확한 하드웨어 구성에 수집되어야 합니다. 교훈은: 접촉 부적 인 조작에 대해서는 실제 데이터가 선택적이지 않습니다.
실제 데이터 를 필요로 하는 때
실제 데이터 수집은 다음의 어떤 작업이 포함될 경우 정당하다:
- ** 접촉 부가한 조작:** 삽입, 스레드, 집합,
-홀, 그리고 힘 피드백이 중요 한 모든 작업. Sim 접촉 모델은 미리미터 미만의 용납 작업에 대한 정확도가 충분하지 않습니다. - ** 변형 가능한 물체:** 옷, 케이블, 식품품, 가방. 변형 가능한 시뮬레이션은 개선되고 있지만 여전히 실제 재료와 질적으로 다른 행동을 생성합니다.
- ** 시각 다양성:** 인공 렌더링이 완전히 다루지 못하는 실제 세계 조명 조건, 객체 텍스처, 배경 및 카메라 관점에서 정책이 일반화되어야 하는 작업.
- ** 하드웨어 특유의 배포:** 특정 카메라를 가진 특정 로봇 팔에서 귀하의 정책이 실행될 때, 그 정확한 설정에 대한 데이터를 수집하면 실시예 격차가 완전히 제거됩니다.
- ** 인간과 로봇 상호작용:** 인간과 함께 손을 주고, 공동으로 집합하거나 공동 작업 공간을 포함하는 모든 작업. 인간의 행동을 현실적으로 시뮬레이션할 수 없습니다.
도메인 무작위 분류 는 한계가 있다
도메인 무작위화
4 가지 텔레오퍼레이션 방법 을 비교
원격 조작 (원격조작) 은 로봇을 원격으로 제어하여 원하는 행동을 보여주기 위한 방법이다. 원격 조작 인터페이스의 선택은 데이터 품질, 수집 속도, 운영자 피로 및 비용에 직접적으로 영향을 미친다. 각 방법에 대한 보다 깊은 기술 세부 사항은 [원격조작 guide] (T3
방법 1: 리더-따라자 팔 (ACT / ALOHA 스타일)
이 작동하는 방법: 운영자는 가벼운 "리더" 팔을 물리적으로 움직이고, 무거운 "후보" 팔은 3~8 ms 지연으로 직접적인 USB 다이내믹셀 버스를 통해 리더의 공동 위치를 실시간으로 복제합니다. 이것은 ALOHA, 모바일 ALOHA 및 2026 년 대부분의 대학 연구 설정에서 사용되는 접근 방식입니다.
** 왜 최고의 데이터를 생성하는지:** 운영자는 물리적인 리더 팔을 통해 자기 수용 피드백을 가지고 있습니다. 그들은 저항, 거의 독창성 강도 및 테이블 접촉을 느낄 수 있습니다. 이것은 시범을 화면 기반 인터페이스보다 부드럽고 일관적이며 더 자연스러운 것입니다. 중력 보완이 가능 (다이나믹셀 전류 제한은 30~50%의 나트워크 토크) 으로 운영자는 상당한 피로 없이 2-3시간 동안 작업할 수 있습니다.
하드웨어 비용:** 리더 팔과 추종자/제작 팔에 3,0008,000달러. 카메라와 계산을 포함한 역당 총 비용은: 15,00035,000달러.
공급: 테이블 표 조작 작업에 대해 시간당 20-35 개의 시범을 수행합니다. 접촉이 풍부한 작업에 가장 빠른 방법은 자기 수용 피드백이 실패한 시도를 줄이기 때문입니다.
**** 심각한 데이터 수집 캠페인, 접촉 풍부한 조작 ( 삽입, 조립), 양동력 작업, 데이터 품질이 우선순위가 되는 모든 시나리오에 적합합니다.
방법 2: VR 헤드셋 (메타 퀘스트 3)
이 작동하는 방식: 운영자는 VR 헤드셋을 착용하고 로봇의 카메라 피드 또는 혼합 현실 시각을 볼 수 있습니다. 손 컨트롤러 위치는 작업장에서 실행되는 역 운동학을 통해 최종 효과 카르테시아 위치로 지도됩니다.
** 늦은 시간:** 15~40 ms (WiFi + IK 계산 + 팔 명령) 대부분의 조작 작업에 적합하지만 정밀 작업에 눈에 띄는.
하드웨어 비용은: $500 헤드셋에 추가 하드웨어, 카메라, 컴퓨터 이외에 없습니다.
공급: 테이블탑 조작을 위해 시간당 15-25개의 시범이 이루어집니다. 리더-따라자보다 약간 낮습니다. 왜냐하면 운영자가 자기소개적 피드백이 부족하고 정확성 작업에 대한 시도가 더 실패하기 때문입니다.
운전자 피로: VR 헤드셋은 60~90분 후 일부운전자에게 메스꺼움을 유발합니다. 시간당 15분간의 휴식을 계획합니다. 최대 실무 세션: 하루에 3-4시간.
**예산에 맞는 팀, 미리미터 미만으로 정밀하지 않은 작업, 데이터 수집 파이프라인의 빠른 프로토타입 제작, 무작위 조작 (집단, 배치, 분류)
방법 3: 스페이스마우스 / 키보드
이 작동하는 방식: 운영자는 6 축 SpaceMouse (200달러) 또는 듀얼 아날로그 게임패드를 사용하여 최종 효과자 속도 또는 공동 속도를 제어합니다. 운영자는 모니터에서 실시간 카메라 피드를 통해 로봇을 관찰합니다.
연속기: 1-5 ms (직접 USB HID). 어떤 방법 중에서도 가장 낮은 연속기, 하지만 제한된 제어 대역폭은 이 장점을 더 이상 이완한다.
출력: 5-12 시속 시범법. 가장 느린 방법은 운영자가 직접적으로 6DOF 포즈를 지정할 수 없기 때문에, 거품 궤도와 최선 미지 경로로로 이어집니다.
** 데이터 품질:** 다른 모든 방법보다 낮습니다. 운영자 사이에서의 시범은 각각 자신의 조이스틱 제어 전략을 개발하기 때문에 일관성이 떨어집니다. 궤도는 더 많은 소음과 의 تردد을 포함합니다.
**** 다른 인터페이스가 없는 경우 빠른 프로토타입 제작, 모바일 로봇 내비게이션 데이터, 팔 궤도의 매끄러움이 비중이 없는 작업.
방법 4: 허프틱 장갑/ 외골격
** 작동 방식:** 운영자는 손 외골격이나 촉각 장갑 (SenseGlove Nova 2 가격: $8,000/쌍 또는 HaptX G1 가격: $ 20,000/쌍) 을 착용하여 손가락 관절 각을 추적하고 능숙한 로봇 손으로 지도를 그리는. 힘 피드백은 운영자에게 객체 접촉을 느낄 수 있고, 실시간으로 잡기력을 조정할 수 있습니다.
출력: 시간당 8~15번의 시범 작업.
운전자 피로력: 높다. 장갑은 신체적으로 까다롭다. 45분 세션 제한과 10분 휴식. 하루 전체 세션 제한: 4-5시간.
****
비교 표
| Method | 정밀도 | Operator Learning Curve | Setup Cost | Demos/Hour | Ideal Task Types |
|---|---|---|---|---|---|
| Leader-Follower | Highest | 1-2 hours | $15K-$35K | 20-35 | Contact-rich, insertion, bimanual, assembly |
| VR / Quest 3 | Good | 30 min - 1 hour | $5K-$12K | 15-25 | Pick-place, sorting, packing, gross manipulation |
| SpaceMouse | Moderate | 2-4 hours | $3K-$8K | 5-12 | Prototyping, navigation, simple manipulation |
| Haptic Gloves | High (dexterous) | 3-6 hours | $25K-$55K | 8-15 | Multi-finger grasping, in-hand rotation, tool use |
에피소드 디자인 원칙
단 하나의 시범을 수집하기 전에, 좋은 에피소드를 구성하는 것을 정의해야 합니다. 나쁜 에피소드 디자인은 낭비된 데이터 수집 노력의 가장 일반적인 원천입니다. 다음은 데이터 세트가 성공적인 정책을 훈련시킬지 결정하는 다섯 가지 디자인 결정입니다.
작업 규격
정확하고 명확 한 작업 설명 을 작성 하여 운영자 가 일관되게 수행 할 수 있습니다. 나쁜: "물질을 들어보세요". 좋은: "상 아래로 찌르는 찌꺼기 를 사용하여 왼쪽 찌꺼기 에서 붉은 거리를 잡아 테이블 위 에 15cm 로 올려 오른쪽 찌꺼기 중점 으로 이동 하여 풀어 놓으십시오. "그건 더 구체적일수록, 당신의 시술이 더 일관성 있고, 당신의 정책은 더 쉽게 배울 수 있을 것이다.
리셋 일관성
장면의 초기 상태를 정확하게 정의하세요. 테이블에 어떤 객체들이 있는지? 그들은 어디에 위치하고 있습니까? 허용 가능한 무작위 범위를 얼마나 알고 있습니까? 각 에피소드의 시작에 로봇 팔이 어떻게 위치하고 있습니까? 잘 정의된 리셋 절차는 에피소드 사이 15-30 초 동안 걸릴 수 있습니다. 만약 재설정 시기가 60초 이상 걸리거나 모호한 배치가 포함되면, 당신은 출력을 잃고 훈련에 영향을 미치는 분포 소음을 도입합니다.
테이블탑 작업에 대해, 운영자가 시나리오를 재설정하는 데 사용하는 템플릿 (지위 표시가 있는 인쇄문이나 조렬 안내문) 을 생성하십시오. 정의된 경계 상자 (일반적으로 15-25cm 광) 내 객체 위치를 무작위로 설정합니다.
관측 공간
추론 시 정책이 무엇을 관찰할 것인지 정확히 정의하고 수집 중에 정확히 그 신호를 기록하십시오. 전형적인 관찰 공간은 다음과 같습니다.
- ** 카메라 이미지:** 480x640 해상도, 30fps에서 2-4뷰 (오버헤드, 손목, 옆) 를 사용하십시오. RGB-D에 대한 Intel RealSense D405/D455 또는 RGB-에서만 사용하는 표준 USB 카메라를 사용하십시오.
- 관절 위치 (qpos): 50 Hz에서 관절 각의 부동 배열. 최종 차원으로 지갑 열을 포함하십시오.
- 공동 속도는 (qvel): 50 Hz에서 공동 각속도의 부동 배열
- ** 최종 효과자 자세:** 선택적 6DOF (지위 + 방향) 50 Hz. 카르테시아 공간 정책에 유용하다.
- 지착기 상태: 50 Hz에서 바이너리 (오픈/ 닫힌) 또는 연속 (오픈 너비)
추론 시 사용하지 않는 신호를 기록하지 마십시오. 추가 사용되지 않은 관찰 차원은 소음과 저장 비용을 이익 없이 증가시킵니다.
행동 공간
행동 공간은 정책이 예측하는 것을 정의합니다. 2026년 대부분의 조작 정책에 있어서, 행동은 다음과 같습니다.
- 공동 위치 목표: ACT 및 방급 정책에서 가장 흔한 선택.
- ** 최종 효과자 속도는:** 일부 카르테시아 공간 정책에서 사용된다. 텔레오퍼레이션 인터페이스에서 명령된 최종 효과자 속도는 기록한다.
- ** 절대 최종 효과자 자세:** 덜 흔하지만 일부 VLA 모델에서 사용된다. 목표 최종 효과자 6-DOF 자세를 기록한다.
** 중요:** 가능한 한 공동 공간에서 동작을 저장하십시오. 대부분의 현대 정책 (ACT, 방산 정책, pi-0) 은 공동 공간에서 동작합니다. 행동으로 카르테시아의 포즈를 저장하는 것은 훈련 시간에 오류가 발생할 수 있는 IK 솔루션을 필요로 합니다. 이는 계산적인 오버헤드를 추가합니다.
에피소드 길이는
에피소드를 최대한 짧게 유지 하 고 전체 작업 을 완료 하는 동안. 전형적인 에피소드 길이는:
- ** 간단한 선택 및 장소:** 3-8 초 (150-400 시간 단계 50 Hz)
- 다단계 조작: 10
25초 (5001,250단계) - 복합 조립: 30
90초 (1,5004,500 시간단계)
긴 에피소드 (>60초) 는 신용 할당 문제 가 기하급수적으로 증가 하기 때문에 배우기 더 어렵기 때문 이다. 만약 당신의 작업 은 자연스럽게 60초 이상 걸리는 경우, 추론 도중 연쇄 되어 있는 하위 작업 에피소드 로 분해 하는 것을 고려 하십시오.
얼마나 많은 데이터가 필요 합니까?
필요한 시범의 수는 정책 구조, 작업 복잡성, 그리고 원하는 성공률에 달려 있습니다.
| Policy Type | Episodes Needed | Evidence | Notes |
|---|---|---|---|
| ACT (Action Chunking with Transformers) | 50 - 200 | ALOHA paper: 50 demos for simple tasks, 200 for bimanual | Most data-efficient architecture for manipulation. Quality matters more than quantity. |
| Diffusion Policy | 100 - 500 | TRI: 200 demos for 94% success on trained tasks | Handles multi-modal action distributions well. Benefits from diverse demonstrations. |
| VLA 미세 조정 (pi-0, OpenVLA, RT-2) | 500 - 2,000 | OpenVLA: 1K demos for single-task fine-tuning | Pre-trained on large data, but fine-tuning still needs substantial task-specific data. |
| From-Scratch 기초 모델 | 5,000 - 100,000+ | RT-2: 130K demos. Open X-Embodiment: 2.2M episodes across 22 robots. | Only relevant if building a generalist model. Most teams should fine-tune instead. |
평단의적 통찰력: 50개의 고품질의 시범은 500개의 저품질의 시범을 매번 우월하게 할 것이다. 간단한 작업의 100개의 시범으로 70% 이상의 정책 성공이 이루어지지 않는다면, 문제는 데이터 품질이나 파이프라인 오류가 아니라 데이터 양이 아닙니다. 더 많은 것을 수집하기 전에 먼저 그 문제를 해결하십시오.
데이터 형식 깊이 다이브
적절한 데이터 형식을 일찍 선택하면 고통스러운 마이그레이션을 더 늦게 방지합니다. 로봇 커뮤니티는 3 가지 주요 형식에 합쳐졌습니다. 완전한 기술적 비교를 위해, 우리의 전용 [HDF5 vs RLDS vs LeRobot 형식 안내서]를 참조하십시오.
HDF5 (위계 데이터 형식 5)
HDF5는 로봇 시범 데이터에 가장 많이 사용되는 형식이다. 이 형식은 단일 파일에서 효율적인 무작위 액세스로 이 heterogeneous 데이터를 (공동 위치, 이미지, 메타데이터) 저장합니다. ACT 및 방산 정책 코드베이스는 HDF5를 원산적으로 사용합니다.
** 에피소드 구조:** 각 에피소드는 관찰, 행동 및 메타 데이터 속성에 대한 데이터 집합을 포함하는 그룹입니다. 여기 표준 ACT/ALOHA 레이아웃입니다:
/episode_0/
observations/
images/
cam_high # uint8 [T x 480 x 640 x 3]
cam_wrist_left # uint8 [T x 480 x 640 x 3]
cam_wrist_right # uint8 [T x 480 x 640 x 3]
qpos # float32 [T x 14] (7 joints per arm)
qvel # float32 [T x 14]
action # float32 [T x 14] (leader arm positions)
attrs:
task = "pick_cube_bimanual"
operator_id = "op_03"
success = True
timestamp = "2026-04-10T14:32:00Z"
robot_serial = "openarm_007"
** HDF5을 언제 사용해야 하는가:** 주요 수집 및 저장 형식으로 사용해야 합니다. 요구에 따라 다른 형식으로 변환하십시오. HDF5는 가장 검사 친화적인 형식이며, 성숙한 파이썬 도구 (h5py, HDFView) 를 가지고 있으며, 어떤 에피소드에서도 어떤 프레임에 대한 효율적인 무작위로 액세스 할 수 있습니다.
RLDS (강화 학습 데이터셋)
구글의 RLDS 형식은 표준화된 스키마를 가진 TFRecord 파일을 사용합니다. 그것은 오픈 X-Embodiment (2.2M+ 에피소드 22 개의 로봇 유형) 및 Octo 일반주의 정책의 네이티브 형식입니다.
** 강점:** 표준화된 스키마는 데이터 세트 에 대한 어댑터 없이 데이터 세트 간 훈련을 가능하게 한다.
** 약점:** TensorFlow 의존성으로 PyTorch 팀의 마찰이 증가한다. 순서적 액세스 패턴 (효율적인 무작위 프레임 액세스) 이 없습니다. 스케마는 딱딱하다.
레로봇 형식 (Hugging Face)
Hugging Face의 LeRobot 형식은 테이블 데이터와 MP4 비디오 카메라 관측을 위해 파켓 파일을 사용합니다. Hugging Face Hub에서 공유하도록 설계되었으며 레로봇 훈련 라이브러리와 네이티브로 통합됩니다.
** 강점:** Hugging Face Hub에 한 명령으로 업로드. 웹 시각화 built-in. 컴팩트 MP4 저장소 (5-10배나 원료 HDF5보다 작다). 300+ 공개 데이터 세트를 가진 커뮤니티 성장. 네이티브 ACT 및 디스포지션 정책 교육 지원.
** 약점:** MP4 코딩은 손실이
** 우리의 권고:** HDF5에서 수집하고 저장합니다.
품질 관리 체크리스트
1,000개의 나쁜 시범을 수집하는 것은 50개의 좋은 시범을 수집하는 것보다 더 나쁘다. 품질은 정책 성과를 직접 결정합니다. 여기 RCSV에서 사용하는 10점 QC 프레임워크가 있습니다. 로봇 데이터를 수집하는 모든 팀에게 추천합니다.
- ** 작업 성공 검증:** 각 에피소드는 전체 작업을 성공적으로 완료해야 합니다. 실패한 시범 (실종된 객체, 놓친 포착, 불완전한 궤도) 은 정책 훈련에 적극적으로 해를 끼칩니다. 실시간 품질 검토를 실시하십시오. 관찰자는 수집 직후 각 에피소드를 성공/실패로 표시합니다. 목표: 최종 데이터 세트에 95% 이상의 성공률.
- ** 시간표 동기화:** 모든 센서 스트림 (카메라, 관절 상태, 동작) 은 <5 ms 용납량으로 시간표 및 동기화되어야 합니다. 하드웨어 트리거 카메라 (워크스테이션에서 GPIO 충동) 및 공유 시계 소스를 사용하십시오 (기록성 NTP 또는 IEEE 1588 PTP). 알려진 이벤트를 기록하여 확인합니다 (팔 접촉 테이블) 모든 스트림이 5 ms 이내에 이벤트를 표시합니다.
- ** 궤도 일관성:** 주어진 작업에 대해, 시범은 유사한 전략을 따라야 한다. A 사업자가 왼쪽에서 선택하고 B 사업자가 오른쪽에서 선택하면 정책은 두 경우 모두 실패하는 모호한 쌍모형 분포를 학습한다. 수집 시작하기 전에 접근 전략, 포착 포인트 및 배치 위치를 정의하십시오.
- ** 장면 다양성:** 객체 위치 (특정 한계 상자 내에서 무작위로), 객체 인스턴스 (분별별로 3~5) , 조명 조건 (상면, 각, 희미) 및 배경 오더러는 체계적으로 다양합니다. 각 수집 세션에 대한 다양성 매개 변수를 문서화하십시오. 다양성 없이, 정책은 실험실의 정확한 장면 레이아웃에 지나치게됩니다.
- ** 프레임 하락 모니터링:** 카메라 스트림은 하락된 프레임에 대한 검사를 해야 합니다. 한 번의 하락된 프레임은 시퀀스 기반 정책을 혼란스럽게 하는 시간적 중단을 만듭니다. 실시간으로 프레임 하락률을 모니터링 합니다. <2%의 프레임 손실을 가진 에피소드를 거부하고 원인을 조사합니다.
- 지착기 상태 일관성: 카메라 증거에 따라 지착기 개방/폐지 신호를 검증합니다. 유령 지착기 사건 (데이터에 따르면 지착기 닫았지만 카메라가 보여주지 않았다고) 은 잡음있는 지착기 센서에서 놀랍도록 흔합니다. 플래그 및 수정 또는 영향을 받은 에피소드를 폐기합니다.
- 공동 제한 준수: 어떤 에피소드는 로봇의 안전한 운영 범위 밖의 공동 위치를 포함해서는 안 된다. 거의 독창성 구성은 액션 분포에서 비정상적 인 극단적인 공동 속도를 생성한다. 하드웨어 제한 내에서 소프트웨어 공동 제한을 5도 설정한다.
- ** 에피소드 길이의 제한:** 작업에 대한 최소 및 최대 에피소드 길이를 정의하십시오. 예상 범위보다 현저하게 짧거나 길어지는 에피소드 (사업이 완료되지 않았습니다) 또는 (운전자의 주저, 거의 실패로부터 회복) 검토를 위해 표시해야합니다.
- ** 메타데이터 완전성:** 각 에피소드의 요구 사항은: 작업 이름, 운영자 ID, 시간표, 로봇 일련 번호, 카메라 구성, 성공/실패 라벨, 이상에 대한 자유 텍스트 메모.
- 운동자 간 일관성: 여러 운용자를 이용하는 경우, 운행자 간 궤도 분포를 매주 비교한다. 합의로부터 현저하게 벗어난 운용자를 재교육하거나 배제해야 한다. 양적 일관성 측정값으로서 공동 운행자 사이의 역동적 시간 왜곡 (DTW) 거리를 사용한다.
파일럿에서 생산에 이르기까지의 규모
개념 증명 데이터 세트에서 생산 규모 데이터로 가는 길은 각 단계에서 의도적인 인프라 투자가 필요합니다. 여기 4 단계의 플레이북입니다.
단계 1: 개념 증명 (50 에피소드)
하나의 운영자, 하나의 로봇, 하나의 작업. 목표는 당신의 원전 운영 설정, 데이터 파이프라인, 훈련 코드를 검증하는 것입니다. 이 데이터에 ACT 또는 방급 정책 모델을 훈련하고 실제 로봇에 평가합니다. 간단한 작업의 50 가지 시범으로 70% 이상의 성공을 거두지 못하면 데이터 품질이나 파이프라인 버그가 문제입니다. 데이터 양이 아닙니다. 근본 원인을 해결하기 전까지는 더 많은 데이터를 수집하지 마십시오.
** 시간:** 1-3일 ** 비용 (내용):** 200~500달러 운영시간
단계 2: 초기 훈련 (200 에피소드)
두 번째 운영자를 추가하여 수집 프로토콜이 운영자 독립적이라는 것을 확인합니다. 자동화된 품질 검사를 구현하십시오. 에피소드 길이의 제한, 공동 제한 위반, 성공/실패 분류. 품질 매트릭을 체계적으로 추적하기 시작합니다. 이 단계에서는 간단한 작업에서 80-90% 이상의 정책 성공을 볼 수 있습니다.
** 시간: ** 1-2 주 ** 비용 (내용): ** 600 $ - 1,500 $ 운영자 시간.
3단계: 제작 정책 (1,000 에피소드)
동일한 하드웨어 구성으로 2-4개의 병렬 수집 역을 배치하십시오. 모든 역의 에피소드를 집계하고 품질 검사를 실행하고 밤마다 훈련 준비된 데이터 세트를 생성하는 중앙 데이터 파이프라인을 사용하십시오. 이 규모에서 운영자 관리는 병목으로 변합니다. 수주 동안 일관된 품질을 유지할 수있는 4-8 명의 운영자를 채용하고 훈련하고 유지하십시오.
** 핵심 투자는:**
- ** 자동 리셋 메커니즘:** 수동으로 장면 리셋을 하는 15~60초를 줄이세요. 1,000 에피소드 간 에피소드당 15초를 절약해도 4시간 이상 운영자의 시간을 절약합니다.
- ** 실시간 품질 대시보드:** 역 당 처리량, 성공률 및 운영자 및 감독자에게 가시적인 품질 측정치. [RCSV 데이터 플랫폼] (
T5 ) 은 이것을 틀에서 벗어납니다. - ** 표준화된 캘리브레이션:** 여러 역에서 카메라 외부와 로봇 기지 캘리브레이션이 표준화되어야 합니다. 2mm의 캘리브레이션 오류가 역들 사이로 체계적인 잡음을 도입합니다.
** 시간:** 2개의 역으로 2-4주 ** 비용 (내용):** 3,0008,000달러 운영자 시간, 30만100만달러 하드웨어
4단계: 기단 모형 기여 (10,000+ 에피소드)
이 규모에서, 당신은 기초 데이터 세트를 구축하고 있습니다. 커뮤니티 이익과 인용 영향을 위해 열린 데이터 세트에 기여하는 것을 고려하십시오. 상호 작용을 위해 RLDS 또는 LeRobot 형식을 사용하십시오. 작업 온토로지 및 메타 데이터 표준에 투자하여 데이터 세트가 연구 그룹 중 탐색 가능하고 재사용이 가능합니다.
** 시간:** 4개의 역으로 26개월 ** 비용 (내용):** 운영자 시간에서 15,00050,000달러+
또는: [이 단계 중 어느 하나에서 RCSV를 채용하여 수집]
비용 계산기: 내부에서 VS RCSV 관리
데이터 수집의 실제 비용을 이해하는 것은 팀들이 정보화 된 구축 대 구매 결정을 내릴 수 있도록 도와줍니다. 500 에피소드 단독 작업 캠페인을 위한 현실적인 비교는 다음과 같습니다.
| Cost Category | In-House | RCSV Managed |
|---|---|---|
| Hardware (robot + teleop + cameras + compute) | $15,000 - $35,000 | $0 (included) |
| Infrastructure setup (workspace, calibration, software) | $2,000 - $5,000 | $0 (included) |
| Operator recruitment and training | $1,000 - $3,000 | $0 (included) |
| Operator labor (500 episodes at 20 demos/hr, $35/hr) | $875 | Included in campaign price |
| QA and quality review | $500 - $1,500 | $0 (included) |
| Engineer time (pipeline, debugging, monitoring) | $5,000 - $15,000 | $0 |
| Total | $24,375 - $60,375 | $8,000 - $15,000 |
| Effective cost per episode | $49 - $121 | $16 - $30 |
내부 비용은 단일 500 에피소드 캠페인에 걸쳐 amortized 하드웨어를 포함합니다. 12 개월 동안 5,000+ 에피소드를 수집할 계획이라면, 내부는 규모로 더 경제적입니다. 일회 또는 초기 캠페인에서는 엔지니어 시간과 기회 비용을 고려하면 관리 수집은 일반적으로 2-4배 더 비용 효율적입니다.
7개의 일반적인 실수
수십 개의 팀과 함께 첫 번째 데이터 수집 캠페인을 진행한 후, 우리는 같은 실수를 반복적으로 보게 됩니다. 이러한 실수를 피하면 몇 주 동안의 낭비된 노력을 절약할 수 있습니다.
- ** 훈련 파이프라인을 검증하기 전에 데이터를 수집합니다.** 팀들은 하드웨어를 구입하고 500개의 에피소드를 수집하고, 그 후 훈련 코드가 모든 데이터를 사용할 수 없는 버그를 가지고 있다는 것을 발견합니다. 항상 10-20개의 테스트 에피소드를 먼저 훈련하십시오. 파이프라인이 로봇을 합리적으로 움직일 수 있는 정책을 생성하는지 확인하세요.
- 운전자 훈련을 무시. 훈련되지 않은운전자는 훈련된운전자보다 3-5배 더 나쁜 데이터를 생산한다. 새로운운전자의 첫 20개의 시범은 캘리브레이션 데이터로 간주되어 폐기되어야 한다. 생산 데이터 수집을 하기 전에 2-4시간의운전자 훈련에 투자한다.
- 불합합성적인 리셋. 만약 장면이 에피소드 간 지속적으로 리셋되지 않는다면, 정책은 임의의 시작 상태를 포함하는 배포를 학습한다. 이것은 강력한 정책을 학습하는데 필요한 데이터를 크게 증가시킨다. 데이터를 수집하기 전에 반복 가능한 리셋 절차를 구축하는 데 시간을 투자한다.
- 실제 시간 질을 모니터링하지 않습니다. 팀들은 종종 전체 데이터 세트를 수집하고, 마지막 200 에피소드에는 위치가 변경된 카메라 또는 유령 신호를 생성하기 시작한 지갑 센서가 있다는 것을 발견합니다.
- ** 잘못된 행동 공간에서 기록.** 카르테시아 최종 효과자 수집은 정책이 공동 위치 (또는 반대로) 를 기대할 때 모든 것을 재처리하거나 재 수집하는 것을 의미합니다. 수집하기 전에 행동 공간을 결정하고 기록된 행동 형식이 귀하의 훈련 코드와 정확히 일치하는지 확인합니다.
- 경상 다양성을 과소평가한다. 객체가 항상 같은 위치에 있는 시범을 훈련시키는 정책은 객체가 5cm 왼쪽으로 떨어져 있을 때 실패할 것이다.
- ** 메타데이터를 생략.** "우리는 나중에 메타데이터를 추가할 것"은 "우리는 결코 메타데이터를 추가하지 않을 것"을 의미합니다. 작업 이름, 운영자 ID, 시간표, 로봇 시리즈, 카메라 구성 및 성공/실패 레이블을 기록하여 각 에피소드에 10 초가 소요되며 후일 혼란을 절약합니다.
RCSV가 훈련 자료를 수집하도록 하십시오
실리콘밸리 로봇센터는 자체 수집 파이프라인을 구축하지 않고도 고품질의 로봇 시범 데이터를 필요로 하는 ML 팀들을 위해 전용 데이터 수집 인프라를 운영합니다. 우리는 하드웨어, 운영자, QA, 형식 변환을 처리합니다.
- **관리된 데이터 수집: ** 50 에피소드 파일럿에서 10,000+ 에피소드 캠페인까지. 당신은 작업을 지정합니다. 우리는 HDF5, RLDS 또는 LeRobot 형식으로 데이터 세트를 제공합니다.
- 하드웨어 패키지: 사전 구성된 데이터 수집 스테이션 (OpenArm + 카메라 + 컴퓨팅 + 소프트웨어)
- 오픈 데이터 세트: 공개적으로 이용 가능한 로봇 조작 데이터 세트 라이브러리를 탐색하세요.
- 데이터 플랫폼: RCSV Fearless 플랫폼을 통해 데이터 세트를 업로드, 시각화, QA 및 수출하십시오.
로봇 데이터 수집이 필요하십니까?
RCSV는 훈련된 운영자, 품질 파이프라인 및 빠른 회전으로 다국적 데이터 수집 시설을 운영합니다. 귀하의 작업에 대해 알려주세요. 우리는 수집 캠페인을 진행할 것입니다.







