Blog(으)로 돌아가기

로봇 데이터 해상: 훈련용 로봇 시연을 어떻게 표기할 것인가

훈련에 필요한 로봇 시범 데이터를 어떻게 해설할 것인가: 성공 표지, 언어 표지, 작업 세그먼트, 품질 표준, 도구 및 RCSV의 해설 파이프라인

[로봇 데이터 수집 안내서]

해설은 로봇 학습의 가장 매력적이지 않은 부분이고 가장 결과적입니다. 잘 해설된 500개의 시범시험의 데이터 세트는 2,000개의 잘못된 표기된 시범시험보다 더 나은 정책을 훈련시킬 것입니다. 로봇 데이터에 대한 해설은 무엇을 의미하는지 그리고 어떻게 올바르게 수행할 수 있는지에 대해 설명합니다.

로봇 데이터 에 대한 해상 의 의미

설명은 상자 그리거나 라벨을 클릭하는 것을 의미하는 이미지 분류와 달리 로봇 시범 설명은 더 풍부하고 구조화되어 있습니다. 하나의 로봇 에피소드 () 는 일반적으로 20~200초의 조작 () 을 여러 수준에서 표시해야 합니다. 에피소드가 성공적이거나 실패한 것인지, 어떤 언어가 작업을 설명하는지, 의미적으로 다른 단계가 어디에서 시작되고 끝나는지, 하드웨어 오류 또는 운영자 오류로 인해 훈련에서 배제되어야 할 프레임이 있습니까?

해고는 일반적으로 인간 평론가들이 관절 상태와 지갑 열의 음반과 함께 녹음된 에피소드의 비디오 재생을 보는 것으로 이루어집니다. 좋은 해고 도구는 여러 카메라에서 동기화된 비디오를 동시에 표시하여 로봇의 자신의 카메라가 명확하게 캡처하지 않을 수 있는 관점에서 성공을 판단하는 것을 쉽게 만듭니다.

해명 유형: 완전 한 분류학

로봇 시범 데이터 는 각기 다른 하류 목적 을 위해 다양한 해설 유형을 지원 합니다. 어떤 해설이 필요하고 어떤 해설이 필요 없는지 이해하는 것은 해설 예산 및 시간 라인을 관리하는데 매우 중요합니다.

에피소드 레벨 해상

Annotation Type Format Required For Cost per 에피소드
Binary success/failure Boolean flag All IL training (ACT, Diffusion Policy, VLA) $0.05-0.10
Language instruction Free-text string Language-conditioned policies, VLA fine-tuning $0.10-0.25
Task category ID Integer enum Multi-task policies, dataset organization $0.02-0.05
시연 quality score 1-5 integer scale Quality-weighted training, dataset curation $0.10-0.20
Object instance IDs List of string IDs Object-centric policies, diversity analysis $0.05-0.10

프레임 레벨 해석은

Annotation Type Format Required For Cost per Frame
Task phase segmentation Timestamped phase boundaries Hierarchical policies, sub-task analysis $0.50-2.00/episode
Contact event labels Timestamped contact start/end Contact-aware policies, force control $0.30-0.80/episode
Object bounding boxes 2D bbox per frame per object Object detection, visual grounding $0.05-0.15/frame
Segmentation masks Per-pixel object mask Semantic segmentation, sim-to-real $0.50-2.50/frame
Keypoint annotations 2D pixel coordinates per keypoint Keypoint-based policies, pose estimation $0.10-0.30/frame
Frame exclusion flags Boolean per frame Removing hardware glitches, operator errors $0.01-0.03/frame

대부분의 모방 학습 프로젝트는 첫 두 에피소드 레벨 해설 (성공 플래그 + 언어 교육) 과 선택적으로 작업 단계 세그먼트 (task phase segmentation) 를 필요로 한다. 세그먼트 마스크와 키포인트 같은 프레임 레벨 해설은 특정 정책 아키텍처 또는 인식 사전 훈련에 필요한데, 그것들은 비싸고 기본적으로 적용되어서는 안 된다.

성공 깃발: 가장 중요 한 해명

로봇 훈련 데이터 세트의 모든 에피소드는 이진 성공 플래그로 표시되어야 합니다. 로봇이 작업을 성공적으로 완료했는지. 이것은 간단하지만, 성공 기준은 해설이 시작되기 전에 정확하게 정의되어야 합니다. "판에 컵을 배치하십시오"는 세부 사항이 필요합니다. 컵이 똑바로 있어야 하는가, 핸들 지향이 중요합니까, 얼마나 많은 위치 오류가 허용되는가? 같은 데이터 세트에 다른 암시적인 표준을 적용하는 해독자는 훈련 성능을 떨어뜨리는 소음적인 레이블을 만듭니다.

해설 시작 전에 성공 및 실패 사례의 이미지를 포함하여 한 페이지의 성공 특산서를 작성하십시오. 이 문서를 해설자를 기동하는 데 사용하십시오. 공유된 에피소드 하위 집합에 대한 해설자 간의 합의를 측정하십시오. RCSV의 해설 파이프라인에는 어떤 데이터 세트가 훈련에 준비될 때까지 명시적인 성공 기준 문서와 해설자 간 합의 검증이 필요합니다.

자동화된 성공 분류

1,000개 이상의 에피소드 데이터 세트에서 수동 성공 레이블링은 비용이 많이 들게 됩니다. 자동 분류기는 불확실한 경우에 인적 검토를 통해 대부분의 레이블링을 처리 할 수 있습니다. 표준 접근법:

  • 유러스틱 분류자: 최종 지갑 상태, 최종 효과자 위치, 그리고 힘/토크값을 사용하여 규칙에 근거한 검사를 한다. 예: 선택 장소 작업에서 지갑이 열려 있는지 확인 (실제) 하고 최종 효과자 는 최종 프레임에서 목표 위치에서 3cm 이내에 있는지 확인한다.
  • ** 학습된 분류자:** 손목 카메라의 마지막 10 프레임에 가벼운 CNN (ResNet-18) 를 훈련시켜 성공/실패를 예측한다. 훈련하기 위해 작업에 200+ 이상의 수동으로 표기된 예제를 필요로 한다. 나머지 모호한 사례를 85-92%의 정확도로 처리한다.
  • 인간의 검토: 자동 분류기가 불확실한 10-15%의 에피소드를 위한 예비 (0.3~0.7 사이의 신뢰성) 이 하이브리드 접근 방식은 전체 수동 라벨링에 비해 5-8배로 해고 비용 감소.

언어 표기

언어 해석은 에피소드 또는 에피소드 세그먼트에 자연어 설명을 첨부합니다. 이 부분은 언어 조건 정책을 훈련시키기 위해 필요합니다. 언어 해석은 또한 비전 언어 행동 (VLA) 모델과 호환성을 가능하게 하며 작업 설명에 따라 데이터 세트를 검색하고 필터링할 수 있습니다.

언어 해설을 두 가지 구체적 수준으로 작성하세요. 짧은 작업 이름 ("컵 배치") 과 자연어 명령 ("백 잔을 들고 파란색 판에 올려다보세요"). 명령은 로봇의 내부 상태가 아니라 인간 관찰자가 보는 것을 설명해야 합니다. 작업이 작업 변형이 포함되면 다른 객체, 다른 목표 위치 각 변형은 다른 것들과 구별되는 적절한 지침을 가져야합니다.

VLA 교육에 대한 언어 표기법

OpenVLA 또는 RT-2와 같은 [VLA 모델]T1) 를 정밀하게 조정할 계획이라면, 언어 해석은 간단한 작업 레이블보다 더 많은 주의가 필요합니다.

  • ** 다양한 문장:** 모든 에피소드 에서 동일한 명령어를 복사- 붙이지 마십시오. "붉은 잔을 들어보세요" 및 "붉은 잔을 잡고 들어보세요"는 모델에게 다른 문장들이 비슷한 동작으로 지도를 만들어 주는 것을 가르칩니다. 작업당 5-10 개의 명령어 변형을 목표로 합니다.
  • ** 참조 표현 을 포함 하십시오:** "거미 를 들어라"는 것 보다 "거미 를 들어라". 이것은 공간적 이성 을 가르칩니다.
  • ** 전체 작업을 설명하세요:** "빨간 잔을 테이블에서 꺼내 파란색 판에 올려 놓으세요"는 "잔에서 판에"보다 낫습니다.
  • 일반된 객체 이름을 사용: "컵", "mug", 또는 "글라스"인지 결정하고 데이터 세트 내에 붙어 넣으십시오.

강제 인식 정책에 대한 연락처 표지

중요한 접촉력을 포함하는 작업에 있어서 삽입, 조립, 표면 후 시간표 접촉 사건 표기들은 시각적 해석이 포착할 수 없는 중요한 정보를 제공합니다. 접촉 라벨은 로봇이 객체와 접촉하거나 접촉을 끊는 프레임을 표시하고, 접촉의 유형 (초접촉, 지속된 잡기, 삽입 접촉, 방출) 그리고 선택적으로 손목 F/T 센서로부터의 접촉력의 크기를 표시합니다.

접촉 레이블은 힘/토크 센서 데이터를 사용하여 부분적으로 자동화 될 수 있습니다. F/T 신호에 있는 임계 탐지기는 접촉 시작 (일본선에서 힘의 크기가 0.5N를 초과) 과 방출 (무력의 임계 이하의 떨어지는) 를 식별합니다. 접촉 유형 (일성 잡음과 충돌) 을 분류하고 F/T 임계값이 우연한 접촉을 작업에 관련한 것으로 잘못 분류하는 경우를 파악하기 위해 인간 검토가 필요합니다.

작업 세그먼트

여러 연속적인 하위 과제를 포함하는 긴 지평선 작업에 대해서는 세그먼트 레이블은 단계 간의 경계를 표시합니다. 테이블 설정 작업은 세그먼트 될 수 있습니다: 도달컵, 잡기컵, 운송컵, 배치컵, 방출컵. 세그먼트는 계층적 정책 훈련, 하위 과제 수준의 성공 메트릭 및 선택적 데이터 증강을 가능하게합니다. 또한 수술적 디버깅을 가능하게 합니다. 운송 중에 정책이 실패하지만 포착 중에 성공하면, 세그먼트 레이블은 부 작업의 성공률을 측정하고 가장 필요한 곳에 데이터 수집 노력을 목표로 합니다.

세그먼트 해석은 성공 표시보다 더 비싸고 항상 필요하지 않습니다. 세 가지 또는 더 많은 의미적으로 구별되는 단계를 가진 작업에 세그먼트를 우선시하거나 계층적 정책 구조를 사용할 계획이라면.

해상 자료 비교

Tool License Video Support Time-Series Multi-Camera Sync Best For
Label Studio Apache 2.0 Yes Limited No (single video) General annotation, extensible via templates
V7 (Darwin) Commercial Yes No No Auto-labeling with SAM, managed workforce
CVAT MIT Yes No No Bounding boxes, segmentation masks on video
Custom Gradio/Streamlit Custom Full control Yes Yes (custom build) Robot-specific workflows with joint state plots
RCSV Platform SaaS Yes Yes Yes (native) Purpose-built for robot episodes with all sensors

로봇 데이터에 대한 일반적 목적으로 쓰이는 해독 도구 (Label Studio, CVAT, V7) 의 주요 한계점은, 그것들은 동기화된 다모달 에피소드 해독이 아닌 이미지/비디오 해독을 위해 설계되어 있다는 것입니다. 로봇 시범을 검토하려면 2-4 카메라 스트림과 함께 상태 시간 시리즈와 함께 힘/토크 플롯이 동시에 표시되어야 합니다. 모든 시간 동기화. 심각한 해설 파이프라인을 만드는 대부분의 팀은 HDF5 에피소드를 직접 읽는 사용자 지정 Gradio 또는 Streamlit 앱을 사용하게 됩니다. RCSV의 데이터 플랫폼 는 데이터 수집 파이프라인과 통합된 웹 기반 인터페이스로 제공합니다.

표기 비용 기준

RCSV의 해고 작업에 기초하여, 여기 각종 해고 구성에 대한 현실적인 비용 기준이 있습니다.

Annotation Configuration Cost per 에피소드 Time per 에피소드 Suitable For
Success flag only (automated + spot-check) $0.05-0.10 5-10 sec ACT, Diffusion Policy (single-task)
Success + language instruction $0.15-0.35 20-40 sec VLA fine-tuning, multi-task BC
Success + language + phase segmentation $0.50-1.50 2-5 min Hierarchical policies, detailed debugging
Full annotation (all above + bboxes) $2.00-5.00 10-20 min Object detection training, perception research
Segmentation masks (per frame, SAM-assisted) $0.50-2.50/frame 30-120 sec/frame Sim-to-real domain adaptation, visual pre-training

성공 플래그와 언어 지침으로 해독된 500 에피소드 데이터 세트 (VLA 미세 조정을 위한 가장 일반적인 구성) 에 대해서는 전체 해독 비용은 약 75~175달러입니다. 이는 데이터 수집 비용의 작은 부분이며, 결코 에 미치지 않아야합니다. 해독의 한계 비용은 잘못된 레이블된 데이터에 대한 재교육 비용보다 훨씬 낮습니다.

품질 통제: 공지사 간 협정

해설자 간 협약 (IAA) 은 여러 해설자들이 동일한 데이터를 얼마나 일관되게 표시하는지 측정한다. 로봇 데이터에 대해서는 관련 매개 변수는 코헨의 카파 (두 해설자) 또는 플레이스의 카파 (세 이상) 이다.

** 로봇 데이터의 목표 IAA 임대:**

  • 바이너리 성공 표기: kappa > 0.85 (뚜렷한 성공 기준 문서로 달성될 수 있다)
  • 작업 단계 경계: kappa > 0.75 (어떤 경계 모호함은 본질적이다)
  • 시범품질 점수는: kappa > 0.65 (품질은 더 주관적이며 중량 kappa는 더 적합하다)

만약 IAA가 이 열대보다 낮으면, 이 항목에 대한 설명 기준은 계속하기 전에 정교화되어야 합니다.

  • ** 저 성공 라벨 합의:** 성공 기준 문서에 가장자리 사례의 사진 예제를 추가하십시오. 정확한 위치 용납력을 정의하십시오 (예를 들어, "목적 중심에서 2cm 이내에 있는 객체 중심").
  • 저분분별 합의: 관찰 가능한 물리적 사건의 관점에서 단계 전환을 정의하십시오 ("그리퍼가 객체에 닫는다"는 것이 아니라 "가근 단계 종료"). 시간표는 사건이 발생하는 프레임과 일치해야 하며, 그 이전 또는 이후에 발생하는 프레임과 일치하지 않습니다.
  • ** 품질 점수 협정:** 스칼라를 5에서 3 수준으로 줄이십시오 (좋은/ 수용가능/ 거절).

해고문 질 표준

RCSV는 모든 데이터 세트에 3단계 품질 게이트를 적용한다. 기록 후 즉시 운영자 자문, 훈련된 해설자로부터 중추 검토, 공동 국가 통계에 대한 해설을 비교하는 자동화된 일관성 검사는 (예를 들어, 그립터가 닫혀 있지 않은 성공적 에피소드들은 재검토를 위해 표시된다).

일반적인 오류를 발견하는 자동화된 일관성 검사는:

  • 최종 효과자가 시작 위치에서 5cm 이상 움직이지 않는 성공 로벨 된 에피소드 → 플래그
  • 성공으로 표시된 에피소드 평균 에피소드 길이의 50% 이상
  • 언어 명령어에는 "왼쪽"이 언급되지만 모든 객체는 작업 공간의 오른쪽쪽에 있습니다
  • 단계 세그먼트는 0.5s 이상 또는 60s 이상으로 짧은 단계
  • 언어 지침이 동일하지만 다른 작업 범주 → 플래그와 인접한 두 에피소드

RCSV의 표기 파이프라인

RCSV의 [데이터 수집 서비스] (T3) 를 이용하면, 해고가 전달되는 내용의 일부입니다. 우리의 운영자는 녹음 세션 동안 성공 플래그와 언어 레이블로 각 에피소드를 해고하고, 우리의 해고 팀은 데이터 세트 수출 전에 중추 검토를 수행합니다. 당신은 높은 신뢰성 해고, 해고자 합의 점수 및 완전한 품질 보고서를 가진 데이터 세트를 받게됩니다.

자체적으로 수집한 데이터를 가져오는 팀들을 위해 RCSV는 다음 단계의 해설 서비스만을 제공합니다:

  • ** 기본 (0.10달러/피소드):** 기존 라벨의 검증 및 청소 성공
  • ** 표준 (0.30달러/episode):** 성공 플래그 + 언어 지침 + 품질 점수
  • ** 전체 (주기 1.50달러):** 단계 분할 및 접촉 라벨을 포함한 모든 해설

지원되는 하드웨어 플랫폼 (ALOHA, OpenArm, Franka, UR, Unitree) 에서 수집된 기존 데이터 세트를 처리할 수 있습니다. 데이터 세트는 HDF5 또는 RLDS 형식으로 있어야 하며 검토에 액세스 할 수 있는 비디오 스트림이 있어야 합니다. [주신]T4) 데이터 세트의 해설 필요에 대해 토론하거나 [RCSV 데이터 플랫폼]T5을 통해 우리의 해설 인터페이스를 탐구합니다.

관련 독서