로봇 데이터 해상: 훈련용 로봇 시연을 어떻게 표기할 것인가
훈련에 필요한 로봇 시범 데이터를 어떻게 해설할 것인가: 성공 표지, 언어 표지, 작업 세그먼트, 품질 표준, 도구 및 RCSV의 해설 파이프라인
[로봇 데이터 수집 안내서]
해설은 로봇 학습의 가장 매력적이지 않은 부분이고 가장 결과적입니다. 잘 해설된 500개의 시범시험의 데이터 세트는 2,000개의 잘못된 표기된 시범시험보다 더 나은 정책을 훈련시킬 것입니다. 로봇 데이터에 대한 해설은 무엇을 의미하는지 그리고 어떻게 올바르게 수행할 수 있는지에 대해 설명합니다.
로봇 데이터 에 대한 해상 의 의미
설명은 상자 그리거나 라벨을 클릭하는 것을 의미하는 이미지 분류와 달리 로봇 시범 설명은 더 풍부하고 구조화되어 있습니다. 하나의 로봇 에피소드 (
해고는 일반적으로 인간 평론가들이 관절 상태와 지갑 열의 음반과 함께 녹음된 에피소드의 비디오 재생을 보는 것으로 이루어집니다. 좋은 해고 도구는 여러 카메라에서 동기화된 비디오를 동시에 표시하여 로봇의 자신의 카메라가 명확하게 캡처하지 않을 수 있는 관점에서 성공을 판단하는 것을 쉽게 만듭니다.
해명 유형: 완전 한 분류학
로봇 시범 데이터 는 각기 다른 하류 목적 을 위해 다양한 해설 유형을 지원 합니다. 어떤 해설이 필요하고 어떤 해설이 필요 없는지 이해하는 것은 해설 예산 및 시간 라인을 관리하는데 매우 중요합니다.
에피소드 레벨 해상
| Annotation Type | Format | Required For | Cost per 에피소드 |
|---|---|---|---|
| Binary success/failure | Boolean flag | All IL training (ACT, Diffusion Policy, VLA) | $0.05-0.10 |
| Language instruction | Free-text string | Language-conditioned policies, VLA fine-tuning | $0.10-0.25 |
| Task category ID | Integer enum | Multi-task policies, dataset organization | $0.02-0.05 |
| 시연 quality score | 1-5 integer scale | Quality-weighted training, dataset curation | $0.10-0.20 |
| Object instance IDs | List of string IDs | Object-centric policies, diversity analysis | $0.05-0.10 |
프레임 레벨 해석은
| Annotation Type | Format | Required For | Cost per Frame |
|---|---|---|---|
| Task phase segmentation | Timestamped phase boundaries | Hierarchical policies, sub-task analysis | $0.50-2.00/episode |
| Contact event labels | Timestamped contact start/end | Contact-aware policies, force control | $0.30-0.80/episode |
| Object bounding boxes | 2D bbox per frame per object | Object detection, visual grounding | $0.05-0.15/frame |
| Segmentation masks | Per-pixel object mask | Semantic segmentation, sim-to-real | $0.50-2.50/frame |
| Keypoint annotations | 2D pixel coordinates per keypoint | Keypoint-based policies, pose estimation | $0.10-0.30/frame |
| Frame exclusion flags | Boolean per frame | Removing hardware glitches, operator errors | $0.01-0.03/frame |
대부분의 모방 학습 프로젝트는 첫 두 에피소드 레벨 해설 (성공 플래그 + 언어 교육) 과 선택적으로 작업 단계 세그먼트 (task phase segmentation) 를 필요로 한다. 세그먼트 마스크와 키포인트 같은 프레임 레벨 해설은 특정 정책 아키텍처 또는 인식 사전 훈련에 필요한데, 그것들은 비싸고 기본적으로 적용되어서는 안 된다.
성공 깃발: 가장 중요 한 해명
로봇 훈련 데이터 세트의 모든 에피소드는 이진 성공 플래그로 표시되어야 합니다. 로봇이 작업을 성공적으로 완료했는지. 이것은 간단하지만, 성공 기준은 해설이 시작되기 전에 정확하게 정의되어야 합니다. "판에 컵을 배치하십시오"는 세부 사항이 필요합니다. 컵이 똑바로 있어야 하는가, 핸들 지향이 중요합니까, 얼마나 많은 위치 오류가 허용되는가? 같은 데이터 세트에 다른 암시적인 표준을 적용하는 해독자는 훈련 성능을 떨어뜨리는 소음적인 레이블을 만듭니다.
해설 시작 전에 성공 및 실패 사례의 이미지를 포함하여 한 페이지의 성공 특산서를 작성하십시오. 이 문서를 해설자를 기동하는 데 사용하십시오. 공유된 에피소드 하위 집합에 대한 해설자 간의 합의를 측정하십시오. RCSV의 해설 파이프라인에는 어떤 데이터 세트가 훈련에 준비될 때까지 명시적인 성공 기준 문서와 해설자 간 합의 검증이 필요합니다.
자동화된 성공 분류
1,000개 이상의 에피소드 데이터 세트에서 수동 성공 레이블링은 비용이 많이 들게 됩니다. 자동 분류기는 불확실한 경우에 인적 검토를 통해 대부분의 레이블링을 처리 할 수 있습니다. 표준 접근법:
- 유러스틱 분류자: 최종 지갑 상태, 최종 효과자 위치, 그리고 힘/토크값을 사용하여 규칙에 근거한 검사를 한다. 예: 선택 장소 작업에서 지갑이 열려 있는지 확인 (실제) 하고 최종 효과자 는 최종 프레임에서 목표 위치에서 3cm 이내에 있는지 확인한다.
- ** 학습된 분류자:** 손목 카메라의 마지막 10 프레임에 가벼운 CNN (ResNet-18) 를 훈련시켜 성공/실패를 예측한다. 훈련하기 위해 작업에 200+ 이상의 수동으로 표기된 예제를 필요로 한다. 나머지 모호한 사례를 85-92%의 정확도로 처리한다.
- 인간의 검토: 자동 분류기가 불확실한 10-15%의 에피소드를 위한 예비 (0.3~0.7 사이의 신뢰성) 이 하이브리드 접근 방식은 전체 수동 라벨링에 비해 5-8배로 해고 비용 감소.
언어 표기
언어 해석은 에피소드 또는 에피소드 세그먼트에 자연어 설명을 첨부합니다. 이 부분은 언어 조건 정책을 훈련시키기 위해 필요합니다. 언어 해석은 또한 비전 언어 행동 (VLA) 모델과 호환성을 가능하게 하며 작업 설명에 따라 데이터 세트를 검색하고 필터링할 수 있습니다.
언어 해설을 두 가지 구체적 수준으로 작성하세요. 짧은 작업 이름 ("컵 배치") 과 자연어 명령 ("백 잔을 들고 파란색 판에 올려다보세요"). 명령은 로봇의 내부 상태가 아니라 인간 관찰자가 보는 것을 설명해야 합니다. 작업이 작업 변형이 포함되면
VLA 교육에 대한 언어 표기법
OpenVLA 또는 RT-2와 같은 [VLA 모델]
- ** 다양한 문장:** 모든 에피소드 에서 동일한 명령어를 복사- 붙이지 마십시오. "붉은 잔을 들어보세요" 및 "붉은 잔을 잡고 들어보세요"는 모델에게 다른 문장들이 비슷한 동작으로 지도를 만들어 주는 것을 가르칩니다. 작업당 5-10 개의 명령어 변형을 목표로 합니다.
- ** 참조 표현 을 포함 하십시오:** "거미 를 들어라"는 것 보다 "거미 를 들어라". 이것은 공간적 이성 을 가르칩니다.
- ** 전체 작업을 설명하세요:** "빨간 잔을 테이블에서 꺼내 파란색 판에 올려 놓으세요"는 "잔에서 판에"보다 낫습니다.
- 일반된 객체 이름을 사용: "컵", "mug", 또는 "글라스"인지 결정하고 데이터 세트 내에 붙어 넣으십시오.
강제 인식 정책에 대한 연락처 표지
중요한 접촉력을 포함하는 작업에 있어서
접촉 레이블은 힘/토크 센서 데이터를 사용하여 부분적으로 자동화 될 수 있습니다. F/T 신호에 있는 임계 탐지기는 접촉 시작 (일본선에서 힘의 크기가 0.5N를 초과) 과 방출 (무력의 임계 이하의 떨어지는) 를 식별합니다. 접촉 유형 (일성 잡음과 충돌) 을 분류하고 F/T 임계값이 우연한 접촉을 작업에 관련한 것으로 잘못 분류하는 경우를 파악하기 위해 인간 검토가 필요합니다.
작업 세그먼트
여러 연속적인 하위 과제를 포함하는 긴 지평선 작업에 대해서는 세그먼트 레이블은 단계 간의 경계를 표시합니다. 테이블 설정 작업은 세그먼트 될 수 있습니다: 도달컵, 잡기컵, 운송컵, 배치컵, 방출컵. 세그먼트는 계층적 정책 훈련, 하위 과제 수준의 성공 메트릭 및 선택적 데이터 증강을 가능하게합니다. 또한 수술적 디버깅을 가능하게 합니다. 운송 중에 정책이 실패하지만 포착 중에 성공하면, 세그먼트 레이블은 부 작업의 성공률을 측정하고 가장 필요한 곳에 데이터 수집 노력을 목표로 합니다.
세그먼트 해석은 성공 표시보다 더 비싸고 항상 필요하지 않습니다. 세 가지 또는 더 많은 의미적으로 구별되는 단계를 가진 작업에 세그먼트를 우선시하거나 계층적 정책 구조를 사용할 계획이라면.
해상 자료 비교
| Tool | License | Video Support | Time-Series | Multi-Camera Sync | Best For |
|---|---|---|---|---|---|
| Label Studio | Apache 2.0 | Yes | Limited | No (single video) | General annotation, extensible via templates |
| V7 (Darwin) | Commercial | Yes | No | No | Auto-labeling with SAM, managed workforce |
| CVAT | MIT | Yes | No | No | Bounding boxes, segmentation masks on video |
| Custom Gradio/Streamlit | Custom | Full control | Yes | Yes (custom build) | Robot-specific workflows with joint state plots |
| RCSV Platform | SaaS | Yes | Yes | Yes (native) | Purpose-built for robot episodes with all sensors |
로봇 데이터에 대한 일반적 목적으로 쓰이는 해독 도구 (Label Studio, CVAT, V7) 의 주요 한계점은, 그것들은 동기화된 다모달 에피소드 해독이 아닌 이미지/비디오 해독을 위해 설계되어 있다는 것입니다. 로봇 시범을 검토하려면 2-4 카메라 스트림과 함께 상태 시간 시리즈와 함께 힘/토크 플롯이 동시에 표시되어야 합니다. 모든 시간 동기화. 심각한 해설 파이프라인을 만드는 대부분의 팀은 HDF5 에피소드를 직접 읽는 사용자 지정 Gradio 또는 Streamlit 앱을 사용하게 됩니다. RCSV의 데이터 플랫폼 는 데이터 수집 파이프라인과 통합된 웹 기반 인터페이스로 제공합니다.
표기 비용 기준
RCSV의 해고 작업에 기초하여, 여기 각종 해고 구성에 대한 현실적인 비용 기준이 있습니다.
| Annotation Configuration | Cost per 에피소드 | Time per 에피소드 | Suitable For |
|---|---|---|---|
| Success flag only (automated + spot-check) | $0.05-0.10 | 5-10 sec | ACT, Diffusion Policy (single-task) |
| Success + language instruction | $0.15-0.35 | 20-40 sec | VLA fine-tuning, multi-task BC |
| Success + language + phase segmentation | $0.50-1.50 | 2-5 min | Hierarchical policies, detailed debugging |
| Full annotation (all above + bboxes) | $2.00-5.00 | 10-20 min | Object detection training, perception research |
| Segmentation masks (per frame, SAM-assisted) | $0.50-2.50/frame | 30-120 sec/frame | Sim-to-real domain adaptation, visual pre-training |
성공 플래그와 언어 지침으로 해독된 500 에피소드 데이터 세트 (VLA 미세 조정을 위한 가장 일반적인 구성) 에 대해서는 전체 해독 비용은 약 75~175달러입니다. 이는 데이터 수집 비용의 작은 부분이며, 결코
품질 통제: 공지사 간 협정
해설자 간 협약 (IAA) 은 여러 해설자들이 동일한 데이터를 얼마나 일관되게 표시하는지 측정한다. 로봇 데이터에 대해서는 관련 매개 변수는 코헨의 카파 (두 해설자) 또는 플레이스의 카파 (세 이상) 이다.
** 로봇 데이터의 목표 IAA 임대:**
- 바이너리 성공 표기: kappa > 0.85 (뚜렷한 성공 기준 문서로 달성될 수 있다)
- 작업 단계 경계: kappa > 0.75 (어떤 경계 모호함은 본질적이다)
- 시범품질 점수는: kappa > 0.65 (품질은 더 주관적이며 중량 kappa는 더 적합하다)
만약 IAA가 이 열대보다 낮으면, 이 항목에 대한 설명 기준은 계속하기 전에 정교화되어야 합니다.
- ** 저 성공 라벨 합의:** 성공 기준 문서에 가장자리 사례의 사진 예제를 추가하십시오. 정확한 위치 용납력을 정의하십시오 (예를 들어, "목적 중심에서 2cm 이내에 있는 객체 중심").
- 저분분별 합의: 관찰 가능한 물리적 사건의 관점에서 단계 전환을 정의하십시오 ("그리퍼가 객체에 닫는다"는 것이 아니라 "가근 단계 종료"). 시간표는 사건이 발생하는 프레임과 일치해야 하며, 그 이전 또는 이후에 발생하는 프레임과 일치하지 않습니다.
- ** 품질 점수 협정:** 스칼라를 5에서 3 수준으로 줄이십시오 (좋은/ 수용가능/ 거절).
해고문 질 표준
RCSV는 모든 데이터 세트에 3단계 품질 게이트를 적용한다. 기록 후 즉시 운영자 자문, 훈련된 해설자로부터 중추 검토, 공동 국가 통계에 대한 해설을 비교하는 자동화된 일관성 검사는 (예를 들어, 그립터가 닫혀 있지 않은 성공적 에피소드들은 재검토를 위해 표시된다).
일반적인 오류를 발견하는 자동화된 일관성 검사는:
- 최종 효과자가 시작 위치에서 5cm 이상 움직이지 않는 성공 로벨 된 에피소드 → 플래그
- 성공으로 표시된 에피소드 평균 에피소드 길이의 50% 이상
- 언어 명령어에는 "왼쪽"이 언급되지만 모든 객체는 작업 공간의 오른쪽쪽에 있습니다
- 단계 세그먼트는 0.5s 이상 또는 60s 이상으로 짧은 단계
- 언어 지침이 동일하지만 다른 작업 범주 → 플래그와 인접한 두 에피소드
RCSV의 표기 파이프라인
RCSV의 [데이터 수집 서비스] (
자체적으로 수집한 데이터를 가져오는 팀들을 위해 RCSV는 다음 단계의 해설 서비스만을 제공합니다:
- ** 기본 (0.10달러/피소드):** 기존 라벨의 검증 및 청소 성공
- ** 표준 (0.30달러/episode):** 성공 플래그 + 언어 지침 + 품질 점수
- ** 전체 (주기 1.50달러):** 단계 분할 및 접촉 라벨을 포함한 모든 해설
지원되는 하드웨어 플랫폼 (ALOHA, OpenArm, Franka, UR, Unitree) 에서 수집된 기존 데이터 세트를 처리할 수 있습니다. 데이터 세트는 HDF5 또는 RLDS 형식으로 있어야 하며 검토에 액세스 할 수 있는 비디오 스트림이 있어야 합니다. [주신]
관련 독서
- [Robot Training Data는 무엇인가?] (
T6 ) -- 데이터 타입, 형식, 품질 차원 - 스칼링 데이터 수집 팀 - 규모의 질량 평가 작업 흐름
- VLA 모델 설명 - VLA 교육에 필요한 언어 해설 요구 사항
- 관계 조작에 필요한 연락력 -- 연락처 라벨 요구 사항
- RCSV 데이터 서비스 -- 해설을 포함한 관리 수집
- RCSV 데이터 플랫폼 -- 해설 인터페이스 및 도구
- 사문 -- 용어 참조







