Blog(으)로 돌아가기

모든 연구소에서 필요한 텔레오퍼레이션 데이터 품질 체크리스트

캘리브레이션, 지연기계획, 액션 평행, 실패 복구 표기, 에피소드 경계가, 인터페이스 선택

텔레오퍼레이션 데이터는 현대 로봇 학습의 원료입니다. 또한 하류 모델이 침묵으로 실패하는 가장 흔한 장소입니다. 이것은 정책을 발송하기 전에 모든 실험실에서 실행하는 체크리스트입니다.

실리콘밸리 로봇센터 연구팀에서 2026-03-27에 발표되었습니다.

TL;DR. 정책 품질은 데이터 품질에 의해 제한됩니다. 데이터 품질은 주로 여섯 가지 요소에 의해 결정됩니다. 캘리브레이션, 지연시간, 액션 평행, 에피소드 경계 징계, 실패 복구 라벨링 및 인터페이스 선택. 대부분의 연구소는 이 두 가지 또는 세 가지에서 실패하고 그것을 알지 못합니다. 새로운 작업 또는 새로운 데이터 수집 캠페인을 시작할 때마다 이 체크리스트를 실행하십시오. 원천에서 문제를 해결하고, 후처리에서 해결하지 마십시오.

1. 기량: 전제 조건

캘리브레이션 오류는 하류 학습 신호를 오염시킵니다. 화요일과 목요일 사이에 카메라 외부 부분이 2cm로 이동하면, 공동 데이터 세트에 훈련된 정책은 혼란스러운 객체 위치 배포를 배울 것입니다. 우리의 [로봇 카메라 설정]T0) 가이드에는 전체 캘리브레이션 스택이 포함되어 있습니다.

캘리브레이션 체크리스트

  • 데이터 수집 세션마다 시작되는 외부 캘리브레이션을 실행하십시오.
  • 로봇이나 카메라 마운트에 물리적으로 충돌한 후 재계급
  • 기록된 에피소드와 함께 버전 제어 캘리브레이션 파일
  • 로그 캘리브레이션 잔재; 잔재가 미리 합의된 임대점을 초과하는 세션을 거부합니다.
  • 쌍손잡이 기구에서는, 두 팔을 공유 세계 프레임에 맞춰 캘리버링하십시오.
  • 손가락 교환 후 지지를 0 위치로 조정하십시오.

2. 지연: 시작하기 전에 설정해야 할 예산

텔레오퍼레이션 지연은 1급 데이터 품질 변수이다. ~ 150 ms의 반여행 이상으로, 인간 사업자는 느려지고 과격으로 보상하기 시작하며, 이는 액션 배포를 독성한다. ~ 300 ms 이상으로, 사업자는 접촉 부양한 작업을 전혀 신뢰할 수 없습니다. 우리는 [테일오퍼레이션에서 인터넷 지연을 처리하는]T1에서 네트워크 측면을 논의합니다.

지연성 체크리스트

  • 매 세션 전에 엔드-투-엔드 레이턴시 (통제자 입력 로봇 움직임) 를 측정한다.
  • 분해: 센서에서 네트워크, 네트워크에서 운영자, 운영자에서 네트워크, 네트워크에서 작동자
  • 세션 레벨의 지연기계획을 설정하고 실행하십시오 (우리는 능숙한 작업에 <80 ms, 테이블에 <150 ms) 를 권장합니다.
  • 예산이 넘는 세션들을 묵묵히 포함하기 보다는
  • 시점표가 있는 퍼프 카운터들을 시범 데이터와 함께 기록합니다.

3· 행동 연평성: 침묵의 부패자

원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원료 원

우리가 추천하는 기본은 고속에서 10-20 Hz 대역에서 낮은 통과 필터입니다. 열차 시간보다는 기록 시간에 적용됩니다. 하류 사용자들이 직접 전화를 할 수 있도록 원료와 매끄러운 스트림을 모두 기록합니다. 액션 킹 아키텍처 (우리 [ACT 정책 설명]를 참조하십시오.

액션 연평화 체크리스트

  • 원료와 부드러운 액션 스트림을 기록합니다.
  • 하나의 데이터 세트에 대해 모든 세션에서 일관된 필터를 사용하십시오.
  • 데이터 세트 메타데이터에서 필터 매개 변수를 기록하십시오.
  • 행동 자동 상관관계 히스토그램을 검사하십시오. 운영자 입력 주파수에서 스피크는 빨간 깃발입니다.
  • 디플로이 측에 매끄러움을 적용하지 않고 기록 측에 매끄러움을 적용하지 마십시오 (또는 반대로).

4· 에피소드 경계: 가장 흔한 라벨링 오류

에피소드는 하나의 일관된 작업 시도, 시작부터 완료, 성공 또는 실패로 이루어져야 한다. 팀들은 정기적으로 에피소드를 함께 피하게 한다. 각각의 경우 에피소드 경계를 손상시키고, 하류 성공률 측정값을 신뢰할 수 없게 합니다.

이 수정은 기술적 것이 아니라 작동적입니다. 에피소드 시작과 에피소드 종료의 제공을 물리적으로 (발 페달, 큰 버튼) 하여, 에피소드 끝에서 명시적인 "성공" 또는 "실패" 분류를 요구하고, 에피소드 경계를 매주 무작위로 5% 검토합니다.

에피소드 경계 체크리스트

  • 가시적인 지표가 있는 물리적 시작/말 신호 (페달, 버튼)
  • 에피소드 끝에서 필수적인 성공/실패 분류
  • 에피소드별 고유 인증을, 검토를 위해 원료 비디오에 첨부합니다.
  • 감사 프로토콜: 셈별로 샘플링된 경계 5%를 매주 검토한다.
  • 예상된 배급을 벗어나 있는 길이의 에피소드를 거부하거나 표기한다.

5. 복구 표시 실패

운영자는 실수를 저지르고 복구합니다. 이러한 복구는 당신이 수집할 수있는 가장 귀중한 데이터 중 하나입니다. 그들은 정책에 나쁜 상태에서 벗어나는 방법을 가르칩니다. 그러나 그들은 표시되면만. 라벨이없는 복구 정책은 "물물을 떨어뜨리고 다시 들어 올립니다"라는 이상한 시범과 같습니다.

각 에피소드 에 세 가지 별도의 상태를 표시: 명칭적 진전, 복구 (운전자 는 오류 를 수정 하고 있다) 및 중단 ( 에피소드 는 일찍 종료 된다). 이 에피소드 에 대한 훈련 정책 은 각 제도 에서 다르게 행동 할 수 있으며 평가자 는 얼마나 많은 복구 가 필요 한 것 으로 성공률을 세분화 할 수 있습니다. 일반적인 실수 목록은 [로봇 모방 학습에서 발생하는 일반적인 실수] (T3) 에 있다.

복구 실패 체크리스트

  • 예를 들어, 운영자 설명서에 "회복"을 명시적으로 정의하십시오.
  • 사업자가 후처리보다는 복구 현상을 실시간으로 ( 버튼이나 음성) 표시하도록 요구한다.
  • 트랙 복구율을 사업자에게; 두 방향으로도 기하급수적 인 재교육 사업자를 재교육한다.
  • 복원된 자료가 각 데이터 집합 버전에서 저장되거나 제외되는지 결정하고, 결정을 문서화한다.

6. 인터페이스 선택: 운동학 vs 리더-따라자 vs VR vs 장갑

인터페이스 선택은 거의 다른 결정보다 더 많은 데이터를 형성합니다. 네 가지 지배적인 옵션은 각각 서명입니다.

운동학 교육

운영자는 중력 보상 모드에서 로봇의 팔을 손으로 움직인다. 접촉이 풍부한 작업에 대한 데이터 품질이 가장 좋으며, 운영자는 직접 접촉을 느끼기 때문에.

리더-따라자 (ALOHA 스타일)

운영자는 운동적으로 유사한 리더 팔을 움직이고, 추종자는 그것을 반영합니다. 뛰어난 에르고노미, 높은 출력, 양동형에 잘 적합합니다. 우리의 [ALOHA 가이드]T4) 는 패턴을 다루고 있습니다. 트레이드오프: 제한된 작업 공간, 리더와 추종자 사이의 캘리브레이션 파동에 민감합니다.

VR/AR 텔레오퍼레이션

운영자는 VR 헤드셋과 핸드 컨트롤러를 사용합니다. 장거리 및 모바일 플랫폼에 탁월하다. 새로운 운영자에게 직관적입니다. 거래: 지연은 예산에 따라 유지하는 것이 더 어렵고, 핸드 트래킹 충실성은 변하다. [VR 텔레오퍼레이션 회사 비교]

데이터 장갑 / 손 추적

운영자의 손 움직임은 직접 캡처되고 능숙한 지갑이나 손에 매핑됩니다. 능숙한 손 조작에 가장 좋습니다. 총 팔 움직임에 가장 약한 것입니다. 여전히 네 가지 중 가장 하드웨어 다양 한 카테고리입니다.

인터페이스 체크리스트

  • 작업의 지배적인 움직임에 맞는 인터페이스를 선택하십시오 (거대 팔과 손에서 능숙한).
  • 데이터 세트 버전마다 하나의 인터페이스를 유지하십시오. 인터페이스를 혼합하면 도메인 전환이 발생합니다.
  • 인터페이스 타입, 펌웨어 버전, 그리고 각 에피소드에서 캘리브레이션을 기록하세요.
  • 선택된 인터페이스에 대한 열차 운영자; 운영자 능력의 변이는 가장 큰 차이로 인터페이스 선택에 지배적이다.

[전체 조작 피로 및 에르고노미]T6에서 운영자 에르고노미를 다루고 있으며, 시작 가이드 는 [이러]T7입니다.

7· 운영자 위생

운영자 변수는 대부분의 연구자들이 인식하는 것보다 더 크다. 다섯 명의 운영자가 수집한 데이터 세트는 한 운영자가 더 긴 시간대에 수집한 것보다 클래스 내 변수가 더 많다. 달콤한 점은 일반적으로 주당 주당으로 회전되는 작업당 2-4 명의 운영자이며, 공유 훈련과 주간 검토 세션이 있습니다.

  • 성공과 실패의 사진과 함께 작성된 작업 스펙.
  • 교육 세트에서 제외된 모든 세션 시작에 10개의 시범을 "온화"하는 세트.
  • 매주 공유된 리뷰 비디오로 3개의 예범적인 시범과 3개의 실패한 시범을 보여준다.
  • 각 에피소드에서 운영자 수준의 메타데이터; 운영자별 성공률 추적

8. 데이터 파이프라인 위생

데이터 품질은 파이프라인 속성이고 세션 속성 아닙니다. 여기서 성공한 팀은 파이프라인을 생산 소프트웨어로 취급합니다.

  • 변화 불가능한 원자재. 원자재 녹음물을 절대 과장하지 마십시오. 파생 데이터 세트는 하류로 구축됩니다.
  • ** 모든 것을 버전.** 데이터셋 버전, 캘리브레이션 버전, 필터 버전, 해설 버전.
  • ** 자동 검증.** 각 에피소드 섭취는 기간, 액션 범위, 카메라 드롭 등에 대한 합격/실패 확인을 받는다.
  • ** 무작위 샘플 검토.** 인간들은 매주 1~5%의 에피소드를 검토합니다.
  • ** 삭제 징계.** 만약 어떤 에피소드가 나쁜다고 판단한다면, 그 에피소드를 표시하고 삭제하지 마십시오.

우리의 [데이터셋 카탈로그] (T8) 및 [데이터 서비스] (T9) 제공은 이 파이프라인을 중심으로 구축되어 있습니다.

9· 일반적인 함정이

  • ** 하나의 데이터 세트에 인터페이스 타입을 혼합한다.** 나쁜 도메인 이동, 손실 곡선에 보이지 않는다.
  • ** 조용한 시계 이동.** 카메라와 동동기를 단일 단조로운 시간 소스에 맞춰 동기화하십시오.
  • ** 정확하지 않은 "더 많은 데이터가 더 낫다" 본능.** 500개의 청정 에피소드는 2000개의 험난한 에피소드를 능가한다.
  • 유지하지 않습니다. 훈련 중에 절대 볼 수 없는 운영자/시경/물질의 테스트 세트를 예약하십시오.
  • ** 가장자리 사례를 무시합니다.** 실패 복구 데이터 및 명칭이 아닌 객체 포즈가 가장 가치있는 슬라이드입니다.

10· 마무리 지명

통신사업 데이터 품질을 강화하는 데 소요되는 한 시간마다 하류 디버깅의 약 10 시간 정도를 절약합니다. 하류 구조보다 상류 수정은 거의 항상 저렴합니다. 데이터 수집을 생산 학문으로 간주하십시오. 가장 새로운 연구원에게 맡겨진 작업이 아닙니다.

만약 여러분이 파이프라인에 두 번째 시선을 원한다면, 우리의 [데이터 서비스] (T10) 팀은 표준 업무의 일환으로 텔레오프 운영을 감사합니다. [하드웨어] (T11), [리징] (T12), [비 비교] (T13), [ 구매자 안내서] (T14), 그리고 [튜토리얼] (T15) 은 이 기능을 처음부터 구축하는 팀들을 위한 참조들을 완성합니다. 또한 읽기에 가치가 있습니다: 왜 텔레오프가 시మ్ 데이터를 이길 수 있습니까, 데이터 수집 팀을 확장, 그리고 좋은 훈련 데이터를 만드는 것은 무엇입니까.

이번을 인쇄하세요. 이 체크리스트는 데이터 수집실 벽에 저장되어 있습니다. 모든 새로운 작업, 모든 새로운 운영체, 모든 새로운 하드웨어 업데이트를 실행하세요.

11· 자주 묻는 질문

실제로는 몇 개의 에피소드가 필요한가?

좁고 잘 정의된 단일 팔 작업과 깨끗한 데이터에 대해, 200-400 에피소드는 일반적으로 연구-디모 품질에 Octo 또는 OpenVLA를 미세하게 조정하기에 충분합니다. 쌍방향 작업은 일반적으로 비교적 품질의 500-1000 에피소드가 필요합니다. 그 문턱을 넘어서 더 많은 에피소드에서 한자 수익은 작업 배포 자체가 확장되지 않는 한 빠르게 줄어들습니다. 우리는 [예산에 따른 VLA 훈련의 규모를 조사] (T19) 에서 계산 측면을 탐구합니다.

우리는 배치 환경이나 실험실에서 데이터를 수집해야 할까요?

두 가지 모두. 대부분의 데이터를 실험실에서 수집하고, 그곳에서 조명, 캘리브레이션, 카메라 배치를 제어합니다. 배포 환경에서 작고 의도적으로 변형된 코퍼스를 수집합니다.

VR 텔레오퍼레이션은 생산 데이터에 충분합니까?

거친 조작과 이동 작업에 대해서는 예, 지연 및 핸드 트래킹 캘리브레이션에 주의를 기울여서. 현명한 핸드 작업 및 접촉 부양한 조립에 대해서는 리더-따라자 또는 장갑 기반 캡처가 여전히 2026 년에서 더 높은 품질의 옵션입니다.

텔레오프 사업자가 얼마나 지불해야 할까요?

미국 시장 요금은 기술 없는 텔레오프용용은 2545달러, 훈련 받은 숙련된 통신용은 5090달러/시간 정도다. 저렴한 노동력으로 인해 고가의 디버깅이 종종 발생하고 있습니다.

기존의 공공 데이터 세트를 사용하여 우리 자신의 수집을 건너뛰면 될까요?

사전 훈련에 있어서, 예 오픈 X-Embodiment은 그런 것입니다. 당신의 특정 실시예와 작업에 대한 최종 정렬에 대해서는 단축 방법이 없습니다. 당신의 정책의 행동은 그것이 정렬된 데이터를 반영합니다.