우수한 조작 과제 에 대한 어려움 규모
조작 작업의 어려움 <unk>을 분류하기 위한 프레임워크 <unk> 간단한 픽업 및 장소에서 접촉 부가적인 조립 <unk>에 각 레벨에 대한 훈련 데이터 요구사항을 제공합니다.
[← 연구]
데이터 수집의 범위를 넓히고, 현실적인 시간표를 설정하고, 리소스를 배정하기 전에 올바른 알고리즘을 선택하기 위해 5 레벨 조작 난이도 규모.
어려움 의 규모 는 중요 한 이유
로봇 학습 프로젝트에서 가장 흔한 실패 모드는 잘못된 기대입니다. 팀에서는 6개월과 5,000개의 시범이 필요한 작업에 2개월과 500개의 시범을 할당합니다. 이러한 실패는 더 나은 초기 작업 특성화로 인해 크게 예방할 수 있습니다.
아래의 난이도 계단은 어떤 데이터 수집이 시작되기 전에 세 가지 질문에 대답하도록 설계되었습니다. 이 작업에 필요한 데이터는 얼마나 많은 것인가? 어떤 알고리즘을 사용해야 하는가? 현실적인 시간선은 무엇입니까? 그것은 조작 학습 문헌과 RCSV의 자체 배포 경험에서 얻은 경험적 결과에 기초합니다.
5단계 난제 프레임워크
레벨 1 제한 없는 최고 학위
가장 간단한 조작 작업 클래스: 로봇은 상하향 접근을 사용하여 고정된 또는 거의 고정된 위치에서 단일 딱딱한 객체를 잡아야 합니다. 접근 중에 접촉 제한이 없습니다. 큰 잡기 용량은 (>5mm), 단일 객체, 안정적인 배경.
- ** 예제 작업:** 수프 캔을 컨베이어에서 뽑아, 블록을 버그에서 트레이로 옮기거나 테이블 표면에서 컵을 뽑아.
- ** 전형적인 시범이 필요:** 200~500
- ** 권장 알고리즘:** H=50의 행동 복제 (BC) 또는 ACT
- 교육 후 기대되는 성공률: 85
95% - 키 오작동 모드: 조명 변경, 새로운 배경, 객체 중심을 벗어나 8cm 이상
레벨 2 잠금으로 다양한 포착
여러 가지 유효한 포착 전략, 부분적인 폐쇄, 다양한 객체 지향 또는 소박한 배경 혼란. 로봇은 하나의 가전적 움직임을 실행하기보다는 여러 실행 가능한 접근법 중에서 선택해야합니다.
- ** 예제 작업:** 엉뚱한 쓰레기통에서 물건을 모으고, 어떤 방향에서든 병을 잡고, 배에서 쏟아붓는 것.
- ** 전형적인 시범이 필요:** 500
2,000 - ** 추천 알고리즘:** ACT 또는 방급 정책
- ** 예상 성공률:** 75~88%
- ** 핵심 도전:** 정책은 다중 모다리티를 처리해야 합니다
레벨 3 다단계 작업 및 도구 사용
두 가지 또는 더 많은 순서적 조작 단계, 도구 사용 (신축, 스크류브라이버) 또는 포착 단계 사이의 객체의 재주류가 필요한 작업. 단계 간 오류 합병은 지배적인 도전입니다.
- ** 예제 작업:** 드래저를 열고 물건을 가져오고, 음식물을 돌리기 위해 스파틀을 사용하며, 모자를 병에 꽂아주세요.
- ** 전형적인 시범이 필요:** 2,000~10,000
- ** 추천 알고리즘:** 시간적 집합 또는 계층적 정책으로 ACT
- ** 예상 성공률:** 60~80%
- ** 핵심 도전:** 단계별 성공률 합성
각각 85%의 두 단계 = 전체 작업 성공의 72%.
레벨 4 접촉 부가 있는 집합
정밀 접촉 및 힘 제어가 필요한 작업:
- ** 예제 작업:** USB 커넥터 삽입, PCB 부품 배치,
구멍 (±1mm 용납량), 스냅 을 가진 집합. - ** 전형적인 시범이 필요:** 10,000~50,000
- ** 추천 알고리즘:** 방전 정책 (트랜스포머), 손목 카메라로 ACT
- ** 예상 성공률:** 50~75%
- 중요한 도전: 카메라 픽셀 해상도의 소음 (1 픽셀 ≈ 0.5
1mm 일반적인 거리에서) 는 필요한 정확성과 비교할 수 있습니다. 손목 카메라는 거의 의무적입니다.
5급 변형 가능한 물체 및 양동적 조정
가장 어려운 작업 클래스는 변형 가능한 재료 (복, 반죽, 케이블), 시크로네이션된 양 팔 궤도를 필요로 하는 쌍방향 조정 또는 매우 긴 지평 (> 60 초) 를 가진 작업, 여러 L3/L4 하위 작업을 결합하는 작업입니다.
- ** 예제 작업:** 옷복, 케이블 라우팅, 수술적 세일, 스냅
을 펴는 샌드위치 집합. - ** 전형적인 시범이 필요:** 50,000+ 또는 기초 모델 정교 조정
- ** 추천 알고리즘:** π0 (물리 지능) 이 두동력; 긴 지평을 위한 정교한 OpenVLA; 변형물용에 대한 사용자 정의 전파
- ** 예상 성공률:** 40
65% - ** 핵심 도전:** 변형 가능한 상태 공간은 무한 차원이다. 현재 로봇 학습 접근법은 이러한 작업을 해결하기보다는 대략적으로 접근한다.
작업 분류학 참조 표
| Task | Difficulty Level | Typical Demos | Algorithm | Notes |
|---|---|---|---|---|
| Top-down bin pick (uniform) | L1 | 200–500 | BC | Fixed SKU, structured environment |
| Mixed bin picking | L2 | 500–2,000 | ACT | Variable object pose, clutter |
| Bottle cap screwing | L3 | 2,000–8,000 | ACT | Force + rotation coordination |
| Drawer open + retrieve | L3 | 3,000–10,000 | ACT / Hierarchical | Two sub-tasks chained |
| USB insertion | L4 | 10,000–30,000 | Diffusion-T | 정밀도 ±2 mm |
| PCB component place | L4 | 20,000–50,000 | Diffusion-T + wrist cam | ±0.5 mm precision |
| T-shirt folding | L5 | 50,000+ or FM | π0 / Diffusion | Deformable, bimanual |
| Cable routing through clips | L5 | 30,000–80,000 | Custom | High variance, contact-rich |
어려움 을 일으키는 요인
- 정확성 요구 사항: 요구되는 정밀성 증가 순서 (10mm → 1mm → 0.1mm) 는 데이터 요구량을 대략 두 배로 증가시켜 알고리즘 변경이 필요할 수 있습니다.
- ** 차단:** 로봇 팔이나 지갑이 중요한 행동 단계에서 카메라 시야를 차단할 때 데이터 요구 사항은 크게 증가합니다. 손목 카메라는 부분적으로 이를 완화합니다.
- 두손 조정: 시크로네이션된 두 팔 운동이 필요한 모든 작업은 기하급수적 상태 공간과 공동 시간 요구 사항으로 인해 자동으로 L4/L5입니다.
- ** 상태 변동성:** 시범 중 환경이 변화하는 경우 (다양한 드래프트 위치, 칸의 물체 수치가 다르면) 데이터 요구는 변동성의 차원성으로 증가한다.
RCSV [데이터 서비스 팀] (
데이터 수집의 범위를 올바르게 조정
RCSV의 팀은 이 어려움 규모에 따라 당신의 작업을 분류하고, 필요한 시범을 추정하고, 당신이 헌신하기 전에 비용과 시간표 추정을 제공합니다.







