Blog(으)로 돌아가기

스케일링 로봇 데이터 수집 팀: 1K에서 100K 시범

확장된 텔레오퍼레이션 팀에서 운영 학습 <unk> 사업자 계층, 규모의 품질 통제, 인프라 선택 및 디모션 비용 곡선.

[← 블로그]

품질이 떨어지는 방법, 병목이 나타나는 곳, 그리고 수백에서 수천 개의 로봇 시범에서 확장되는 비용 곡선이 어떻게 생겼는지

품질 감소: 세 가지 경고 신호

로봇 데이터 수집을 확장하는 대부분의 팀은 1,000개의 시범표준을 같은 벽에 맞습니다. 품질은 점차적으로 떨어지지 않습니다. 완전히 발생하기 전에 품질 위기를 예측하는 세 가지 구체적인 신호는 다음과 같습니다: 사업자 간 변동의 급증 ( 같은 작업은 사업자마다 매우 다른 궤도 스타일을 생성합니다), 거부율이 40% 이상 상승 (당신의 자동화된 파이프라인은 수집된 데이터의 거의 절반을 폐기하고 있습니다) 및 파이프라인의 병목이 나타납니다 (저기, 사전 처리, 또는 검토 단계가 수 많은 시간을 줄이기 시작합니다).

근본적인 이유는 스켈링 프로세스가 필요없이 팀의 인원을 확장하는 것입니다. 정의되지 않은 프로토콜에 다섯 번째 또는 10번째 운영자를 추가하면 출력보다 불합동성을 증폭시킵니다. 수정은 구조적이며, 레이어링으로 시작합니다.

사업자 모집: 무엇을 찾아야 하는가

운영자 품질의 유일한 최고의 예측자는 로봇 기술 지식이 아닌 미세 운동 제어 경험입니다. RCSV의 최고 성능의 운영자는 수술 기술, 치과 위생, 시계 제조, 경쟁 게임 및 음악 악기의 성능의 배경을 가지고 있습니다.

운영자의 성공과 상관관계를 갖는 특정 검사 기준:

  • ** 수동 기술 테스트:** 시간적 핑크 삽입판 (30 핑크 60 초 이하에서 후보자의 아래 40%를 제거합니다). 이 $ 15 테스트는 어떤 재개편 스크린보다 수집 처리량을 더 잘 예측합니다.
  • ** 지속적인 관심:** 2 시간 동안 일관된 성능을 유지할 수 있는 능력. 게임이나 미세 수술 배경이 있는 지원자들은 일반적으로 여기서 우수합니다.
  • ** 프로토콜 준수:** 정밀한 리셋 절차를 따르려는 의지가 있다. 즉흥적인 크리에이티브 운영자는 규모의 책임입니다.
  • ** 공간적 추론:** 로봇의 최종 효과자 좌표 프레임에 자신의 손 움직임을 지도 할 수 있습니다. VR 게임 경험은이 기술에 대한 강력한 대리입니다.

로봇 기술 배경에 대한 과잉 지표를 피하십시오. 로봇 분야의 박사학위 학생들은 반복적인 시범을 실행하는 대신 시스템을 이해하고 최적화하려는 것이기 때문에 보통 중간적인 운영자를 만듭니다. 가장 좋은 운영자 프로필은 엔지니어가 아닌 정해진 기술자입니다.

5 일 동안 운영자 훈련 교육 과정

RCSV는 여러 캠페인 유형에 걸쳐 40개 이상의 운영자를 통합한 후 이 교육과정을 개발했습니다. 매일 전날을 기반으로 운영자가 진출하기 전에 게이트 테스트를 통과해야합니다.

1일: 안전 및 하드웨어 오리엔테이션 (4시간)

  • 모든 로봇 역에서 전자 정류 위치 및 절차
  • 리더-따라자 팔에 있는 점 식별
  • 전원 종료 시퀀스 및 하드웨어 오류 프로토콜
  • 카메라와 센서 케이블 라우팅
  • ** 게이트 테스트:** 모든 작동 위치에서 5초 이내에 비상 정지 및 전력 절감을 실행합니다.

2일: 텔레오퍼레이션 인터페이스 친숙화 (6시간)

  • 리더 팔 관절 지도 리더 관절이 어떤 팔 팔 팔을 제어하는지 이해하는
  • 자유 공간의 움직임: 작업 공간에서 아무 것도 접촉하지 않고 최종 효과기를 목표 지점 20개로 이동합니다.
  • 작업 공간의 경계 인식 공동의 제한, 독자성을 피하는
  • ** 게이트 테스트:** 0개의 작업 공간 경계 위반 없이 3분 이내에 10개의 자유 공간에 도달하는 작업을 완료하십시오.

3일: 업무 특수한 훈련 (6시간)

  • 시계 금 표준 시범 (QA 리드 세트에서 10위)
  • 시각적인 예로 작성된 성공 기준 문서를 검토
  • 감독 아래 연습 작업 실시간 피드백을 가진 20개의 시범
  • 본인의 시범을 금표와 함께 재현하는 것을 검토
  • ** 게이트 테스트:** 10개의 연속적인 시범과 함께 80% 이상의 첫 승 승 승률 (QA 수석에 의해 판단)

4일: 품질 표준 및 자기 평가 (4시간)

  • 품질 측정 기준 검토: DTW 거리와 에피소드 기간, 부드러운 점수
  • 자기표시 연습: 자신의 에피소드를 검토하고 성공/실패를 표기
  • 해독자 간 협정 캘리브레이션: 50개의 에피소드로 나뉘어 있는 레이블, 금 레이블과 비교
  • ** 게이트 테스트:** 성공/실패 라벨에 대한 QA 납 90% 이상으로 있는 공표자 간 협정

5일: 생산 작업 흐름 및 캘리브레이션 (4시간)

  • 전체 제작 작업 흐름: 재설정 절차, 에피소드 시작/정지, 메타 데이터 입력, 자율 QA 확인
  • 생산량 기준: 생산 속도와 함께 20개의 시범을 완료하고 시범 시기를 측정합니다
  • 피로 관리: 일정한 휴식 프로토콜 (90분마다 15분)
  • 문 시험: 작업 계층의 출력 목표 내에서 20개의 연속 생산 품질 시범

게이트 테스트를 통과하지 못한 운영자는 그 날의 훈련을 반복합니다. 우리 경험에 따르면, 약 15%의 지원자는 3일 (사업 수행) 에서 씻어내고 5일 (지속성 처리) 에서 5%를 더합니다. 커리 ?? 럼을 완료하는 80%는 첫 번째 생산 세션에서 품질 표준을 충족시키는 데이터를 생산합니다.

운영자 계층 및 작업 유형에 따라 처리량 벤치마크

이 기준은 30개 이상의 캠페인에서 RCSV 생산 데이터를 기반으로 한다. "투로푸트"는 자동화된 품질 필터링과 수동 스팟 체크를 통과하는 시간당 에피소드를 연결하는 사용가능한 시범입니다.

Task Type Expert Operator Trained Operator New Operator (post-training) Reset Time
Simple pick-place (single arm) 10-12 demos/hr 7-9 demos/hr 4-6 demos/hr 15-20s
Multi-object sorting 8-10 demos/hr 5-7 demos/hr 3-5 demos/hr 30-45s
Bimanual coordination 6-8 demos/hr 4-6 demos/hr 2-4 demos/hr 45-60s
정밀도 insertion (±1mm) 5-7 demos/hr 3-5 demos/hr 1-3 demos/hr 30-45s
Deformable object manipulation 4-6 demos/hr 2-4 demos/hr 1-2 demos/hr 60-90s
Mobile manipulation 3-5 demos/hr 2-3 demos/hr 1-2 demos/hr 90-120s

핵심 통찰력: 전문가와 새로운 사업자 사이의 격차는 간단한 작업에 2-3배나 복잡한 작업에 3-5배나 있습니다. 이 때문에 계층 시스템은 중요합니다.

운영자 계층 시스템

세 단계의 운영자 구조는 작업 복잡성을 위해 기술 수준을 지도하고 중요한 곳에서 품질을 희생하지 않고 비용을 제어합니다.

  • ** 주니어 오퍼레이터 ($22/h):** 작고 숙련된 작업에 할당된 단일 팔의 도달, 평면 전송, 반복적인 버닝 픽업. 목표 출력: 시속 1218 데모. 탑승 시간: 금 표준 리플레이에 대한 캘리브레이를 포함하여 4 시간.
  • 고위 사업자 ($30/시간): 복잡한 집합, 쌍방향 조정, 제한된 삽입 작업을 처리합니다. 첫 통과 수용률은 85% 이상으로 예상됩니다. 주간 캘리브레이션 세션에 참여하고 모호한 프로토콜 사례를 표시 할 수 있습니다.
  • QA 리드 ($45/h): 작업 프로토콜을 설계하고 금 표준 데모 세트를 정의하고, 캘리브레이션 세션을 실행하고, 자동화된 분류자 임대치를 관리하고, 표시된 대량에 대한 최종 검토를 수행합니다. 810 운영자당 1 QA 리드 는 지속 가능한 비율입니다.

QA 작업 흐름: 3 게이트 품질 파이프라인

규모로, 모든 에피소드를 수동적으로 검토하는 것은 불가능합니다. 세 게이트 파이프라인은 비용 증가에 따라 품질 문제를 잡습니다. 그래서 저렴한 자동 검사는 비용이 많이 드는 인간 검토가 나머지 부분을 실행하기 전에 명백한 문제를 필터링합니다.

게이트 1: 자동적인 헤우리스틱 체크 (비용: ~ $0.001/피소드)

각 에피소드 녹음 후 즉시 실행합니다. 이 검사들은 결정적이고 명백히 무효의 에피소드를 거부합니다.

  • 시간 제한: 작업 유형에 대한 3s보다 짧거나 3x 이상의 중간 이상의 에피소드 → 거절
  • ** 센서 완전성:** 어떤 카메라 스트림에도 > 2개의 프레임이 떨어졌거나, 또는 공동 상태 로그링 격차 > 50ms → 거부
  • ** 작업 공간의 한계:** 최종 효과는 어떤 지점에서든 정의된 작업 공간 봉투를 남겨두고 있습니다 → 거부
  • ** 지리 상태:** 지리 작업 중 절대 닫지 않거나 장소 작업 중 닫지 않음 → 거부
  • ** 속도 스피크:** 공동 속도는 <3x>로 설정된 금 표준의 95번째 퍼센틸을 초과합니다

게이트 1는 일반적으로 원료 에피소드의 5-15%를 거부하고 더 가까운 검사로 다른 10-20%를 표시합니다. 거부율은 건강 측정값입니다. 20%를 초과하면 하드웨어, 운영자 또는 프로토콜에 문제가 있습니다.

게이트 2: ML 기반의 성공 분류 (비용: ~$0.01/피소드)

가벼운 CNN 분류기 (손목 카메라의 마지막 10 프레임에 있는 ResNet-18) 는 바이너리 성공/실패를 예측한다. 작업에 대한 금 표준 라벨 에피소드 200개 이상에 훈련된다. RCSV 생산에서 다음과 같은 성능 수준에서 작동한다:

  • 진정한 긍정적 비율 (성공을 정확하게 확인한다): 92~96%
  • 진정한 부정률 (실패를 정확하게 확인): 75-85%
  • "불확정"로 분류된 에피소드 (신뢰 0.3-0.7): 8-12% → 게이트 3로 로우트

분류기는 "성공" 라벨에 고의로 고밀성을 위해 조정됩니다. 성공으로 표시된 실패한 에피소드를 포함하는 것이 잘못된 거부로 좋은 에피소드를 잃는 것보다 더 나쁘다. 거부 된 에피소드와 불확실한 에피소드는 인간 검토로 안내됩니다.

게이트 3: 인문 전문가 리뷰 (비용: ~ $0.50-2.00/episode)

QA 리드는 게이트스 1 및 2에 의해 표시된 모든 에피소드를 검토하고, 두 게이트를 통과한 에피소드의 무작위 5% 샘플을 (계급을 위해) 검토합니다. 리뷰는 2x 속도에서 동기화된 멀티 카메라 재생을 보는 것을 포함하고 성공 기준에 대한 검사를 포함한다. 무작위 샘플은 지속적인 감사로 작용합니다 무작위 샘플링된 에피소드의 합격률이 분류자의 합격률에서 5% 이상 떨어져 있다면 분류자가 재교육을 필요로 합니다.

질적 통제

금 표준 디모시트는 확장 가능한 품질의 기초입니다. 각 작업에 대해, 이상적인 조건에서 질적 평가 리드에서 기록된 정확히 50 개의 금 표준 디모시션을 유지하십시오. 이 세 가지 목적이 있습니다: (1) 기본 라인을 탑재하는 새로운 사업자는 첫 번째 세션 전에 10위 자리를 지켜보고 있습니다; (2) 캘리브레이션 주간 세션은 동일한 설정에 대한 금 표준에 대한 사업자의 출력을 비교합니다; (3) 분류자 훈련 레이블 자동화된 성공 분류자가 이 라벨 세트에 정렬되어 있습니다.

주간 캘리브레이션 세션은 10 명의 운영자 이상으로 협상할 수 없습니다. 각 세션은 30~45 분 동안 진행됩니다. 운영자는 5 개의 표준화된 작업 인스턴스를 완료하고, 결과를 금 표준에 의해 포즈 궤도 DTW 거리와 비교하고, 배타자들은 개별적으로 코치됩니다. 기량 작업에 대한 운영자 간 변동은 주요 지표입니다. DTW 스프레드가 주마다 증가하면 프로토콜이 유도되었습니다.

자동 성공 분류기는 실무에서 실패의 약 60%를 잡습니다. 전형적인 아키텍처: 손목 카메라 스트림의 마지막 10 프레임에 가벼운 CNN, 바이너리 성공/실패 출력, 작업당 200+ 라벨된 예제에서 훈련. 잘못된 긍정적 비율은 잘못된 부정보다 더 중요합니다.

50K 데모 캠페인에 대한 팀 구조

50,000명의 시위 캠페인은 심각한 운영 과제입니다. RCSV가 이 규모의 캠페인을 위해 사용하는 팀 구조와 시간표는 다음과 같습니다:

Role Count Responsibility Shift Pattern
Campaign Manager 1 Schedule, budget, client comms, overall quality Full-time
QA Lead 2 Protocol design, calibration sessions, Gate 3 review Full-time, staggered shifts
Senior Operators 4-6 Complex tasks, bimanual, mentor junior operators 6hr shifts, 2 shifts/day
Junior Operators 8-12 Simple pick-place, resets, structured variation execution 6hr shifts, 2 shifts/day
Data Engineer 1 Pipeline maintenance, format conversion, storage management Full-time
Hardware Tech 1 Robot maintenance, camera calibration, station setup Full-time

** 시간표:** 6개의 로봇 스테이션이 하루에 2번씩 운영되고 평균 6개의 사용 가능한 데모/시간/역의 처리량을 가지고 있는 원료 수집률은 대략 430개의 사용 가능한 데모/일 (파업, 리셋, 캘리버레이션 세션, 하드웨어 다운타임 등을 계산한다). 50,000개의 데모는 하드웨어 문제점들을 위한 램프업, 프로토콜 반복 및 버퍼를 포함하여 약 116개의 작업일이 필요한다.

** 하드웨어:** 6 OpenArm 1 역 (4,500 달러 각) 또는 동등한 리더-따라자 설정. 한 역에 3 카메라 (2 손목 + 1 대부). 중앙 집중된 NAS 첫 3 개월 동안, S3 마이그레이션 30TB 마크. 훈련용 계산을 제외한 hardware 예산: 35,000-50,000 달러.

운영자 피로 관리

피로감은 침묵적인 품질 살인자입니다. RCSV의 생산 데이터는 일관된 패턴을 보여줍니다. 시범 품질 (황금 표준에서 DTW 거리를 측정하면) 는 90 분 연속 수집 후 15-25% 감소합니다. 3 시간 후에 품질은 40% 감소하고 거부율이 두 배로 감소합니다. 이것은 의지력 문제가 아닙니다.

모든 사업자에게 의무적인 휴식 프로토콜:

  • 15분 간격 90분마다 (역에서 떨어져서 컴퓨터에서 데이터를 검토하지 않습니다)
  • 누적 수집 시간 3시간 후 30분 휴식
  • 최대 6시간의 수직 모집, 실제 수직시간은 4.5시간이 넘지 않습니다.
  • 매번 휴식시 손목 스트레칭 운동 (복복번 스트레스 위험을 줄이는)

일부 팀은 운영자를 8시간의 수집 시위로 밀어 넣으려고 노력합니다. 이것은 반효과를 낳습니다. 지난 2시간 동안 수집하는 데이터가 더 비싸 (저출량) 이며 거부될 가능성이 더 높습니다 (품질이 낮습니다). 적절한 휴식시로 6시간의 시기의 사용가능한 정비 출력은 8시간의 시기의 사용가능한 정비 출력을 초과합니다.

인프라: 중앙 집중식 NAS vs. S3

수집된 데이터의 50TB 이하에는 RAID-6를 가진 중앙 집중된 NAS는 운영적으로 더 간단하고 월 0.01GB/월에 약 $0.01/GB에 비해 훨씬 저렴합니다.

50TB 이상 20 명의 운영자가 약 6 개월에 도달하는 팀 S3는 지연을 제외한 모든 차원에서 승리합니다. 내구성은 최고의 하드웨어 과잉에 비해 11 9입니다. 전개 데이터베이스를 지 않고 에피소드 메타데이터를 통해 SQL 쿼리를 첨부 할 수 있습니다. 그리고 당신은 계층 저장: S3 표준에서 뜨거운 에피소드, S3 글래시어에서 완료 작업 아카이브는 월 0.004/GB에 있습니다.

파이프라인 자동화 단계가 가장 큰 성능 향상을 가져다줍니다: (1) 훈련 준비된 형식의 자동 HDF5에서 Zarr 변환, (2) 지잡기 카메라 미니얼에 대한 인식 해시를 통해 에피소드 분배 ( 동일한 동작을 다시 기록하는 컨트롤러 오류를 잡는다) 및 (3) 질의하기 위해 PostgreSQL 지표로 메타 데이터 추출 (물질 포지, 성공 레이블, 운영자 ID, 기간)

데이터 파이프라인 규모 아키텍처

50K+ 디모에서 데이터 파이프라인은 인적 개입 없이 섭취, 검증, 해고, 저장 및 수출을 처리해야 합니다.

로봇 스테이션 → 녹음 에이전트 (HDF5 에피소드 당) ↓ 흡수열 (Redis) ↓ 게이트 1: 유리스틱 검증기 (Python, 50ms/episode) ↓ 통과/부산 게이트 2: 성공 분류기 (ResNet-18, GPU, 200ms/episode) ↓ 통과/불확정/부산 메타데이터 추출기 → PostgreSQL 지표 ↓ 객체 저장소 (NAS → S3 50TB) ↓ 밤마다 배치 형식 변환기 (HRob5 → Zarr / Leot / RLDS) ↓ 수출 API → 클라이언트 다운로드 / HuggingFace 푸시

주요 설계 원칙: 각 로봇 역의 녹음 에이전트는 모든 센서 데이터 및 메타데이터로 자립된 HDF5 파일을 작성합니다. 파이프라인 하류는 단순히 로보트가 온라인으로 있는지에 의존하지 않고 파일 기반 처리입니다. 이 분리 방식은 하드웨어 다운타임이 파이프라인 백록을 생성하지 않으며 파이프라인 문제가 수집을 차단하지 않는다는 것을 의미합니다.

디모당 비용 곡선

규모의 경제는 현실적이지만 실현하기 위해서는 의도적인 인프라 투자가 필요합니다.

Scale Per-Demo Cost Key Cost Driver
100 demos $80/demo Setup amortization, no automation benefit
1,000 demos $45/demo Pipeline automation kicks in, NAS amortized
10,000 demos $25/demo Full tier utilization, S3 lifecycle savings
50,000 demos $16-20/demo Cross-task operator scheduling, batch QA
100,000 demos $12–18/demo Projected — requires dedicated QA software tooling

가장 급격한 하락은 설치 비용과 파이프라인 개발을 amortize 할 때 100에서 1,000 시범 사이에 발생합니다. 다음 의미있는 굴곡은 자동화된 품질 분류가 대부분의 수동 검토를 대체할 충분한 정확성을 달성 할 때 5,000 시범경에 발생합니다. 10,000 이상, 이득은 주로 운영자 활용 개선 더 긴 세션, 작업 배팅 및 크로스 작업 운영자 스케줄링에서 발생합니다.

은폐 비용은 종종 놓쳐집니다: 하드웨어 유지보수. 50K+ 디모에서, 2000 개의 디모마다 지갑 패드를 교체할 것으로 예상합니다. 교체당 15-50 달러 (약 1 대 2 대 3 대 3 대 3 대 3 대) 이며, 매달 카메라를 재계정 (약 200 달러/역 기술 시간) 하고, 10,000 개의 디모에 한 개의 주요 팔 수리 (약 500-2,000 달러) 를 위해 예산. 유지보수 전체 수집 비용의 8-12%를 예산을 예산합니다.

시작

만약 500개 이상의 시범을 계획한다면, 직원을 채용하기 전에 프로토콜 문서화와 캘리브레이션 인프라에 투자하세요. 정의되지 않은 프로토콜에 대한 두 번째 운영자의 소외 비용은 그들이 추가하는 가치보다 더 높습니다.

RCSV의 [데이터 수집 서비스] (T2) 는 운영자 팀, 프로토콜 설계 및 품질 관리 인프라를 제공 합니다. 이는 처음부터 운영 조직을 구축하지 않고 확장해야 하는 팀들을 위해 특별히 구축되었습니다. 파일럿 캠페인은 200 개의 시범을 위해 2500 달러에서 시작됩니다. 전체 질량 검증으로. 전체 규모 캠페인은 위 비용 곡선을 일치하는 볼륨 계층으로 시범 가격으로 제공됩니다.

자체 운영을 구축하는 팀: 하나의 [OpenArm 1]T3] 역에서 2 명의 운영자와 1 명의 QA 리더를 시작하십시오. 500 개의 데모를 수집하십시오. 자동화된 품질 파이프라인이 작동하는지 확인하십시오. RCSV 플랫폼 은 데이터 관리 도구 섭취, 검증, 해설 및 수출 을 제공합니다. 따라서 처음부터 인프라 구축보다는 수집 작업에 집중할 수 있습니다.

관련 독서

데이터 수집을 확장할 준비가 되셨습니까?

RCSV는 전문 사업자, 질적 평가 인프라 및 투명한 시범 비용 가격으로 관리된 로봇 데이터 수집을 제공합니다.

[데이터 서비스를 탐구]