로봇 데이터 플라이휠을 만드는 것: 첫 번째 디모에서 지속적인 개선
로보틱스 팀들이 데이터 플라이휠을 만드는 방법 <unk> 수집, 훈련, 배포, 실패를 확인, 더 많은 것을 수집합니다. 지속적인 로봇 학습에 대한 실용적인 가이드
[← 가이드]
로봇 학습에서 승리하는 팀은 가장 많은 데이터를 가진 팀이 아닙니다. 배포 실패와 목표 데이터 수집 사이의 가장 빠른 피드백 루프를 가진 팀입니다. 이 가이드에서는 그 루프를 만드는 방법을 보여줍니다.
로봇 데이터 플라이휠 은 무엇 입니까?
데이터 플라이휠은 로봇을 배치하면 개선하기 위해 필요한 데이터를 생성하고, 로봇이 더 유능하게 만들어, 더 많은 배포 기회를 창출하고, 더 많은 데이터를 생산합니다. 루프의 각 회전으로 인간의 소외적 노력이 감소하는 정책 성능을 높입니다.
이 개념은 소프트웨어 회사로부터 빌려온 개념입니다. 더 많은 사용자가 더 많은 쿼리를 생성하여 순위 알고리즘을 개선하여 더 많은 사용자를 끌어들이기 때문에 Google 검색이 좋아집니다. 로봇 분야에서, 플라이휠은 다른 화폐를 사용합니다. ** 실패 에피소드**.
2026년 가장 유능한 로봇을 만드는 회사들은 모두 데이터 플라이휠을 운영한다. 테슬라는 공장에서 수백 개의 옵티머스 유닛을 운영하며 모든 조작 시도를 기록한다. 특정 작업 변종에서 유닛이 실패하면 그 실패를 표시하고, 인간이 수정을 증명하고, 데이터가 다음 훈련 주기로 공급된다. 피시컬 인텔리전스 (Physical Intelligence) 의 pi0 모델은 파트너 배포에서 지속적으로 텔레오퍼레이션 데이터를 섭취함으로써 향상됩니다. 이 아키텍처는 모든 규모에 적용됩니다.
왜 대부분의 실험실 이 플라이휠 에 실패 하는 이유
대부분의 로봇 연구소는 한 번 데이터 수집하고, 정책을 훈련시키고, 그것을 평가하고, 그 다음 성공을 선언하거나 다른 무차별 시범을 수집합니다. 이것은 비행륜이 아닙니다. 중요한 차이점은 ** 타겟팅**입니다. 플라이휠은 이미 정책이 잘 처리하는 조건에 대한 더 많은 데이터를 수집하는 대신 배포로 밝혀진 실패 모드를 특별히 타겟팅합니다.
비행륜 ループ
로봇 데이터 플라이휠은 연속적인 주기를 형성하는 6 단계로 구성됩니다.
1. 수집
→
2차선
→
3· 배포
→
4. 모니터
→
5. 실패를 감지
→
6. 더 많은 것을 수집
↑ 2단계로 다시 공급된다: 기차
1
1단계: 씨 데이터셋 (50200 시범)
시드 데이터 세트는 기본 정책을 설정합니다. 목표는 생산 준비 정책이 아닙니다. 그것은 배치 기반의 실패 광산이 생산적이 될 정도로 자주 (40
"초등 훈련 에 충분 한 것"이 어떠 한 것 인가
- ** 작업 범위:** 목표 작업의 가장 간단한 의미 있는 버전으로 시작하세요. 최종 목표는 "미화 항목을 캔으로 분류하는 것"이라면 "알은 한 개 항목을 선택하고 하나의 캔에 넣으십시오".
- ** 알고리즘에 따라 디모 카운트:** ACT: 50
200 디모. 방출 정책: 100 300. VLA 미세조 (OpenVLA/Octo): 50 100 사전 훈련된 기반. 검증 성공률 평판을 달성하기 전까지는 수집하지 마십시오. - 운동자 일관성: 다양한 크라우드소싱 사업자 아닌 1
3명의 훈련된 사업자를 사용하십시오. 다양성은 나중에 도움이 됩니다. 시드 단계에서 동일한 전략의 일관된 시범은 동일한 시범수단에서 다양한 전략을 능가합니다. - ** 품질 게이트:** 훈련에 추가하기 전에 모든 에피소드를 검토하십시오. 운영자 의 의 의 의 > 2 초, 재 접근 (특별히 복구 데이터를 수집하지 않는 한) 으로 복구 된 실패 포착, 조작 포인트의 카메라 폐쇄 또는 미완성 작업 실행을 가진 에피소드를 거부하십시오.
씨앗 데이터셋 시간표
경험 많은 운영자 및 검증된 [텔레 운영 설정] (T3
2단계: 첫 번째 배치 및 모니터링
씨 데이터 세트에 대한 훈련 후 테스트 환경에서 정책을 배포하십시오. 이것은 생산 배포가 아닙니다. 이것은 ** 다음 플라이휠 회전을 주도하는 오류 데이터를 생성하도록 설계된 ** 기기 배포입니다.
텔레오퍼레이션 그림자 모드
완전히 자율적인 배포 전에 정책은 그림자 모드에서 실행하십시오. 정책은 행동을 예측하지만 운영자는 원격 조작 오버라이드를 유지합니다. 정책이 실패할 경우, 운영자는 작업을 맡고 완료합니다. 정책의 예측 행동과 운영자의 수정 행동을 모두 기록합니다.
그림자 모드는 두 가지 목적을 가지고 있습니다. 그것은 정책의 실제 국가 배포 (정책이 문제가 되는 국가) 에서 훈련 데이터를 생성하고, 인간의 안전망을 제거하기 전에 정책 행동에 대한 안전한 평가를 제공합니다.
성능 모니터링
배포 중 각 에피소드 에 대해 다음을 기록하십시오:
- ** 전체 에피소드 기록:** 공동 위치, 카메라 이미지, 액션 및 시간표
훈련 데이터와 동일한 형식. - ** 결과 표지:** 성공, 실패 또는 운영자 개입. 가능한 경우 자동으로 표지 (예를 들어, 성공 = 대장 카메라에 의해 대상 영역에서 감지된 객체)
- 실종 범주: 에피소드가 실패하면, 실패를 분류하십시오. 범주: 잡기 실패, 배치 오류, 충돌, 시간 종료, 복구 실패, 배포 상태. 이러한 범주들은 3 단계를 진행합니다.
- ** 정책 버전:** 각 에피소드를 생성한 모델 체크포인트로 표시합니다.
해산물 채굴 인프라
최소 실행 가능한 실패 기록 시스템 은 에피소드_id, 타임 스탬프, 정책_버전, 결과, 실패_부문, 메모 등으로 된 CSV 파일입니다. [RCSV 데이터 플랫폼]
3단계: 광산 실패
실패 마이닝은 플라이휠을 작동시키는 핵심 혁신입니다. 더 많은 시범을 광범위하게 수집하는 대신, 성능을 제한하는 특정 실패 모드를 식별하고 그 모드를 직접적으로 다루는 데이터를 수집합니다.
우선 순위 를 정하지 않는 것 을 알아내기
50
- ** 주파수:** 가장 자주 발생하는 오류 모드는 무엇입니까?
- ** 수정성:** 일부 오류는 데이터로 해결될 수 있습니다 (정책은 그런 상태를 본 적이 없습니다). 다른 것들은 하드웨어 변경이 필요합니다 (로봇은 물리적으로 목표를 도달 할 수 없습니다). 데이터 수집을 더 많은 시범이 해결할 수있는 오류에 집중하십시오.
- 영향: 특정 객체 변종의 100% 시도를 차단하는 실패 모드는 모든 변종에서 간헐적 실패를 일으키는 것보다 더 높은 우선순위를 갖는다.
해설 전략
- ** 시간표 해설:** 각 실패 에피소드 에 대해 실패 시작 된 시간표 를 표시 하십시오. 이 는 정책 훈련자 에게 궤도의 어느 부분 에 강화 가 필요 하는지를 정확히 알려 줍니다.
- ** 상태 해석은:** 실패 시점에 있는 상태를 설명하라: "물질은 45도 회전되었고, 지갑은 잘못된 각에서 접근했다". 이것은 수정 데모를 위한 데이터 수집 전략을 안내한다.
- ** 클러스터 분석:**
기점에서의 시각적 유사성으로 그룹 실패 에피소드. 20 번의 실패 모두 로봇이 객체를 같은 방식으로 놓치고 있는 것을 보여준다면, 그 클러스터는 훈련 배포에서 하나의 주소 가능한 격차를 나타냅니다.
4단계: 목표형 데이터 수집
이 때 플라이휠이 보람을 얻습니다. 더 많은 200개의 일반적인 시범을 수집하기 보다는 (이러한 결과로 수익이 줄어들게 됩니다.) 3단계에서 확인된 가장 높은 실패 모드를 대상으로 한 30
특정 실패 모드 수집
- Grasp 실패: 정책 실패한 구성을 설정하고, 이러한 특정 상태에서 성공적인 시범을 원격으로 수행합니다. 실패 지역을 커버하기 위해 접근 각과 지갑 시기를 변경합니다.
- ** 위치 오류:** 객체가 이미 잡힌 상태에서 시범을 시작하십시오 (잡기 단계를 건너뛰십시오). 목표에 정확한 조화를 통해 배치 궤도에 집중하십시오.
- ** 복구 시범:** 정책은 거의 실패 상태 (예를 들어, 약간 잘못 잡은 객체) 를 도달 할 때까지 실행하십시오. 텔레오퍼레이션을 통해 회수 및 복구 시범을 수행하십시오. 이러한 "회복 시범"은 에피소드 당 가장 높은 가치의 데이터입니다.
- 한자 케이스 커버링: 특정 객체 위치 또는 방향에서 오류가 집합되면, 해당 위치를 구체적으로 커버하는 시범을 수집하십시오. 장애 영역의 일관된 커버링을 보장하기 위해 물리적 템플릿 또는 격자를 사용하십시오.
목표 집적 대 일반 개선
일반적인 실수 는 실패 를 목표로 하는 대신 "모든 것 보다 더 많이"를 수집 하는 것 이다. 수학 은 분명 하다. 정책 이 이미 처리 하는 조건 들 에 걸쳐 100 가지 시범 을 일률적으로 추가 하는 것 은 무시 할 수 없는 개선 을 가져옵니다. 정책 이 실패 하는 특정 지역 에 30 가지 시범 을 추가 하는 것 은 그 실패 모드 에 대한 성공률 을 15~25% 증가 시키게 됩니다.
인프라 요구 사항
작동하는 플라이휠은 기본적인 데이터 수집을 넘어 인프라가 필요합니다. 각 단계에서 필요한 것은 다음과 같습니다.
데이터 파이프라인
- ** 에피소드 저장:** 모든 배포 에피소드 (일 뿐 아니라 훈련 데이터) 는 전체 녹음 및 메타 데이터와 함께 저장되어야 합니다.
- ** 에피소드 태그:** 에피소드를 타입에 따라 태그: "씨", "목적 복구", "배포 성공", "배포 실패", "자동적으로 수집".
- ** 자동 섭취:** 새로운 에피소드는 수집 또는 배포 기계에서 훈련 데이터 세트에 수동 파일 복사 없이 흐르게 됩니다. rsync, 공유 NFS 마운트 또는 클라우드 동기화 (S3/GCS) 를 사용하십시오.
모델 버전
- 훈련된 정책 체크포인트마다: 데이터 세트 버전, 하이퍼파라미터, 훈련 날짜, 유효성 측정값을 표시합니다.
- 각 배포 에피소드를 생성한 정책 버전을 기록하십시오. 이 체인은 디버깅 성능 회귀에 필수적입니다 ("정책 v3는 v2보다 더 나쁘다
무엇이 변경되었습니까?"). - 로블백을 위해 최소 5개의 정책 체크포인트만 사용해야 합니다. 저장 비용은 최소 (100~500 MB/ 체크포인트) 이다.
자동화된 재교육
- 새로운 에피소드를 위한 데이터 세트 디렉토리를 모니터링하는 스크립트를 구성하고, 새로운 N 에피소드 (일반적으로 25
50) 배트가 사용할 때 훈련 실행을 시작합니다. - 하루 종일 재교육을 실행하기 위해 작업 스케줄러 (cron, Ray, Modal) 를 사용하십시오. 따라서 새로운 정책은 다음 아침 배포 세션에 준비됩니다.
- 각 훈련 경주 후 자동으로 표준화된 평가 (20번 시뮬레이션 또는 재연전) 를 실행하고 체크포인트 옆에 결과를 기록합니다.
모니터링 대시보드
최소한, 시간이 지남에 따라 이러한 측정값을 추적하십시오.
- 정책 버전별 성공률 (무는 실제로 개선되고 있습니까?)
- 정책 버전별로 실패 모드 분포 (목적 수정 작업이 가능한가?)
- 플라이휠 회전당 수집된 에피소드 (집업 노력이 감소하는가?)
- 실패 확인부터 재교육 정책까지의 시간 (당신의 주행 시간)
추적 할 수 있는 측정
| Metric | What It Measures | Target | Red Flag |
|---|---|---|---|
| Success rate | % of deployment episodes that succeed | Increasing each rotation | Flat or decreasing after new data |
| 일반화 score | Success rate on unseen conditions vs. seen conditions | >0.7 ratio | <0.5 (severe overfitting) |
| Data efficiency curve | Success rate improvement per N new episodes | Diminishing returns curve visible | No improvement despite more data |
| Cost per successful episode | Total collection cost / number of new successes | Decreasing each rotation | Increasing (flywheel is stalling) |
| Cycle time | Days from failure detection to retrained policy | <1 week | >2 weeks (pipeline bottleneck) |
| Failure mode coverage | % of identified failure modes with targeted data | >80% by rotation 3 | Same failure mode persists after 2 targeted collections |
흔히 발생하는 비행기 에 걸리는 함락
1. 분산 시프트 축적
** 무슨 일이 일어나는지:** 각 플라이휠 회전으로 특정 실패 모드에 대한 목표 데이터가 추가됩니다. 시간이 지남에 따라 훈련 분포는 가장자리 경우와 복구 시나리오에 크게 기울어집니다. 정책은 잘 처리하는 데 사용된 "연활한" 경우에 실패하기 시작합니다.
정치: 훈련 집합에서 6070%의 기본 시범과 3040%의 목표 데이터의 비율을 유지하십시오. 목표 데이터를 추가할 때, 기본 데이터들을 제거하지 마십시오. 훈련 집합이 너무 커지면, 기본 데이터들을 완전히 떨어뜨리기보다는 균일하게 샘플링하십시오. 회전 중 고정된 "기본 평가 집합"에서 성능을 모니터링하십시오.
2· 표기 불일치
** 무슨 일이 일어나는지:** 다른 팀원들은 실패를 다르게 분류한다. 한 사람은 거의 실패한 포착을 "성공"이라고, 다른 사람은 "실패를 포착한다". 실패 통계 자료는 신뢰할 수 없게 되고, 목표집합은 잘못된 방향으로 향한다.
** 수정:** 각 실패 카테고리별로 표본 이미지로 명시적인 해설 지침을 작성하십시오. 성공/실패의 기본 레이블으로 바이너리 레이블을 사용하십시오 (이러한 것은 더 어렵지만, 실패의 하위 카테고리들은 부차적 레이블으로 사용됩니다. 매월적으로 해설자 간 합의 확인을 실행하십시오. 성공/실패 레이블에 대한 90% 이상의 합의가 필요합니다.
3· 하드웨어 유동
** 무슨 일이 일어나는지:** 몇 주 동안 로봇 관절은 반작용을 일으키고, 지탱 고무가 쇠퇴하고, 카메라 마운트가 약간 느슨해진다. 로봇의 신체적 행동은 훈련 데이터 배포로부터 유도되어, 데이터 문제처럼 보이는 점진적인 성능 저하를 초래한다.
** 수정:** 각 배포 주 초에 기량 검사를 수행: 로봇을 5 개의 알려진 구성에 명령하고 0.5도 이내에 관절 위치 일치 확인. 힘 가등으로 지갑 힘을 확인. ArUco 보드로 카메라 외부를 확인. 에피소드 데이터와 함께 로그 기량 검정 결과가 발생합니다. 하드웨어 유지 보수가 발생하면 수리된 하드웨어에서 20
4. 해결된 작업에 대한 더 많은 데이터를 수집
** 무슨 일이 일어나는지:** 가장 흔한 플라이휠 오류. 팀은 이미 90% 이상의 성공률을 가지고 정책에 대한 다른 200 개의 시범을 수집합니다. 그 동안, 실제 세계 성능을 제한하는 3 가지 실패 모드는 해결되지 않습니다.
** 수정:** 각 수집 세션 전에 "내가 어떤 특정 실패 모드를 목표로 하고 있는가?"에 대한 답변을 해 보십시오. 만약 하나를 명명할 수 없다면, 먼저 10개의 정책 배포를 실행하고 가장 흔한 실패를 확인하세요. 이 규율은
사례 연구: 0에서 10,000 에피소드까지의 조작 시작
이 가설적인 사례 연구는 창업자가 쓰레기통을 뽑는 시스템을 구축하는 데 있어서 현실적인 비행륜의 진행을 보여준다.
1개월: 씨앗 데이터 세트
팀에서는 리더-후보 텔레오퍼레이션으로 단일 ViperX-300 S2를 사용합니다. 한 경험이 풍부한 운영자는 통통에서 알려진 하나의 객체를 뽑아 컨베이어에 배치하는 200 개의 깨끗한 시범을 수집합니다. 작업: 제어된 조명, 단일 객체 유형, 고정된 통통 위치. 그들은 ACT 정책을 훈련합니다. 결과: ** 55% 성공률** 제어된 설정에서.
2 월: 첫 번째 실패 광산 회전
그들은 100개의 평가 에피소드와 로그 실패에 대한 정책을 배포합니다. 실패 분포: 45%의 포착 실패 (물질 지향은 훈련 데이터보다 더 많이 달라집니다), 30%의 배치 오류 (운전 벨트 위치 용납성이 너무 엄격합니다), 25%의 타임아웃 (정책은 접근에 갇혀 있습니다). 60개의 목표형 디모를 수집합니다. 30개의 객체 지향을 다양하게, 20개의 정확한 배치, 10개의 접근 복구에 대한 학습입니다.
3 월: 일반화 확장
그들은 5가지 추가 객체 유형 (다양한 모양, 크기와 무게) 를 도입한다. 새로운 객체에서 초기 성공률은 35%로 떨어진다. 그들은 위치/지향 변동으로 6개의 객체에서 150개의 데모를 수집한다. 그들은 다 객체 분포를 처리하기 위해 ACT에서 디스포지션 정책으로 전환한다. 결과는: 68%의 성공률은 모든 객체.
4 월: 적극적 학습
그들은 불확실성 추정 (3 정책의 집합) 을 시행한다. 불확실성 로그를 적용한다. 불확실성이 문턱을 초과하면, 인간 시범을 위해 상태를 표시한다. 그들은 성공률 향상에 따라 무확정성 타겟 데모 80개를 수집합니다. 성공률 향상에 따라 무작위로 300개에 해당하는 값입니다. 결과: 82% 성공률.
56 월: 스케일링 및 자동 수집
현재는 자율적인 수집을 위해 충분한 성공률을 보이고 있다. 그들은 로봇을 8시간 동안 자동적인 성공 검출을 통해 실행한다. (오버헤드 카메라는 객체 배치를 확인한다). 인간 리뷰는 20%의 자동 레이블된 에피소드를 생성한다. 자동 수집은 밤마다 200개의 검증된 에피소드를 생성한다. 그들은 두 번째 로봇 역을 추가한다. 전체 데이터 세트: 3,500 에피소드. 결과: ** 알려진 물체에서 91%의 성공률, 새로운 물체에서 78%의 성공률**.
월 712: 생산 플라이휠
두 개의 로봇 역은 오프타임 동안 연속적인 수집을 수행합니다. 주간 리트레이닝은 그 주 실패의 목표 데이터로 이루어집니다. 새로운 객체 범주에 매달 확장됩니다. 월 12: 10,000+ 에피소드까지, 알려진 객체에서 95%의 성공, 같은 범주에 있는 신규 객체에서 85%. 비행륜은 일주일에 약 5 시간 동안 인간 감독으로 자립합니다.
RCSV 를 사용 하는 시점 은 언제 가
| Scenario | RCSV | In-House |
|---|---|---|
| Seed dataset (first 200 demos) | Faster — our operators are trained, hardware is calibrated | Good if your team needs to learn the data collection process |
| Targeted failure-mode data | Strong — we specialize in collecting edge-case data efficiently | Requires operator training for each failure mode |
| Scaling to 1,000+ episodes | Cost-effective — we provide shifts, QA, and infrastructure | Good if you have dedicated operators and hardware |
| Hardware you don't own yet | Lease from RCSV — try before buying | Requires capital outlay upfront |
| Bimanual or dexterous data | Specialized — we operate ALOHA and glove systems | Significant hardware and operator investment |
| Continuous flywheel operation | Hybrid: RCSV handles collection, you handle training/deployment | Best if you have a dedicated data ops team |
시간 순서: 부트 스트랩에서 자립형 플라이휠
| Month | Phase | Activity | Expected Outcome |
|---|---|---|---|
| Month 1 | Seed | 200 clean demos, 3 training runs | 40–60% success on controlled setup |
| Month 2 | Failure mining | 100 deployment episodes, 60 targeted demos | 65–80% success, failure modes identified |
| Month 3 | 일반화 | 150 demos with object/position variation | 70–80% success across 3x variation range |
| Month 4 | Active learning | 80 uncertainty-guided demos | >80% success, equivalent to 300 random demos |
| Month 5 | Auto-collection pilot | Autonomous collection, 20% human review | Validated auto-labeling; 200 episodes/day |
| Month 6+ | Self-sustaining | Continuous auto-collection + weekly retraining | 90%+ success; continuous improvement |
RCSV 를 사용하여 데이터 플라이휠을 가속화 하십시오
RCSV는 데이터 플라이휠 프로그램을 실행하는 팀들을 위해 목표형 데이터 수집, 실패 복구 시범, 에피소드 QA 및 파이프라인 배달을 제공합니다. 우리는 이미 가지고 있는 데모를 수집하지 않습니다.







