Guides(으)로 돌아가기

로봇 학습 교육과정을 설계: 작업 순서화 및 어려움 진행

로봇 학습을 위한 교육과정을 설계하는 방법 <unk> 간단한 작업 순서에서 복잡한 작업 순서, 시범 요구 사항 및 전송 학습 전략

[← 가이드]

본능적 인 기술을 습득하는 것부터 복잡한 다단계 조작을 통해 모방 학습을 위한 교육과정 설계에 대한 구조화된 접근 방식

교육 계획 이 중요 한 이유

복잡한 작업으로 로봇 학습 프로그램을 시작하는 것은 팀에서 가장 흔하고 가장 비싼 실수입니다. 초점부터 두 개의 매뉴얼 매듭하는 것과 같은 복잡한 작업에 직접 훈련된 정책은 첫 2,000 개의 시범에서 유용한 것을 배우지 못할 것입니다. 작업 공간이 너무 크고 보너스 신호는 너무 희소하며 네트워크는 이전에 구축 할 수있는 기술을 가지고 없습니다.

잘 설계된 교육과정은 원시적인 기술에서 복잡한 구성에 이르기까지의 작업들을 순서로 구성하고 있으며, 각 단계는 이전 단계에서 습득한 기술에 기반을 두고 있습니다. 그 결과: 보다 빠르게 학습하고 더 잘 일반화하고 더 적은 전체적인 시범이 필요합니다. RCSV에서 교육과정을 사용하는 팀은 복잡한 조작 작업에 대한 전체 시범 요구 사항을 직접적인 엔드-투-엔드 교육과 비교하여 **40-60%**로 줄였습니다.

이 개념은 인간의 모터 학습에서 직접 빌려 왔습니다. 아이들이 잡을 수 있기 전에 관절하는 법을 가르치지 않습니다. 로봇학에서는 이론은 ** 커리 ?? 럼 학습** (Bengio et al., 2009) 으로 공식화됩니다. 증가하는 어려움에 의해 순서대로 된 예제들에 대한 훈련은 무작위로 순서하는 것보다 더 나은 일반화를 만들어냅니다.

로봇학 교육과정 학습 이론

로봇 조작의 맥락에서 교육과정 학습은 세 가지 이론적 기둥에 기반하고 있으며, 각각의 기둥은 작업의 순서와 시범 예산의 배분 방법에 실질적인 영향을 미칩니다.

어렵지 않게 주문

기본 원칙: 우선 더 쉬운 작업을 제시하고, 더 어려운 버전을 점차 도입한다. 조작을 위해 "단순"은 접촉 전환이 적고, 지평이 짧고, 시각적 변동이 적고, 초기 조건이 더 제한되어 있다는 것을 의미합니다. 일반적인 조작 교육과정에 대한 구체적인 순서:

  1. ** 고정 위치 포착** 물체는 항상 같은 자세, 같은 조명, 같은 배경에 있습니다. 정책은 기본 시각 모터 지도를 배우습니다.
  2. 변경 위치 포착 20cm x 20cm 영역 내에서 무작위로 객체 위치를 파악합니다.
  3. ** 다양한 객체 포착** 다양한 위치에서 여러 개 객체 모양을 학습합니다. 정책은 형태 적응 포착을 학습합니다.
  4. ** 순서 조작** 선택, 운송, 장소. 여러 상태의 전환.
  5. ** 접촉에 풍부한 작업** 삽입, 조립, 힘에 민감한 작업.

각 단계가 다음 단계로 진출하기 전에 최소 **90%의 성공률을 달성해야 합니다. 더 어려운 작업을 효율적으로 배우기 위한 기초가 부족한 정책에 대한 너무 이른 폐기물 시범을 진행합니다.

자동 교육 과정 방법

수동 교육과정 설계는 작업의 어려움에 대한 인간의 판단이 필요합니다. 자동 교육과정 방법은 정책의 현재 역량에 따라 학습 알고리즘이 직접 훈련 할 수있는 작업을 결정하도록 합니다.

Method How It Works Best For Limitation
Self-paced learning Up-weight training samples where the policy's loss is low (already learned) or in a "learning zone" (moderate loss) Large, heterogeneous demonstration datasets Requires all data upfront; no active collection
Competence-based progression Evaluate policy on current stage every N episodes; advance when success rate > threshold Active data collection pipelines (RCSV default) Requires evaluation infrastructure between stages
Hindsight relabeling Failed demonstrations are relabeled as successes for easier goals (e.g., "reach to where the object ended up") Goal-conditioned policies; RL fine-tuning Not directly applicable to pure IL without RL component
Domain randomization scheduling Gradually increase visual/physical randomization range during training Sim-to-real transfer; robustness training Requires simulation environment

실제, RCSV는 능력 기반의 진행을 적극적인 데이터 수집 프로젝트에서 사용한다: 현 교육과정 단계에서의 시범을 수집하고, 훈련, 평가하고, 성공 문턱이 충족되면만 진행한다. 이것은 정책이 아직 배울 수 없는 시범을 수집하는 데 많은 사업자의 시간을 낭비하는 것을 방지합니다.

실패 사례 주입

성공적인 시범을 포함한 교육과정은 취약한 정책을 만들어냅니다. 도입된 정책이 새로운 상황에 직면하고 부분적으로 실패하면 회복 궤도를 본 적이 없으며 일반적으로 완전한 실패로 떨어지는 배포 상태에 들어갑니다.

** 고의적인 실패 주입**은 각 교육 과정 단계에 10-20%의 실패 및 복구 시범을 포함함으로써 이를 해결합니다.

  • Grasp 실패: 운영자는 의도적으로 약한 포착을 수행하고, 슬립을 감지하고, 재 포착합니다. 정책은 슬립 탐지 및 복구에 대해 학습합니다.
  • ** 위치 오류:** 운영자는 객체를 약간 중심에서 벗어나 접근하고 중간에 수정합니다. 정책은 수정 행동을 학습합니다.
  • 물질의 혼란: 접근 중에 두 번째 사람이 물체를 움직인다. 운영자는 재계획한다. 정책은 반응적 재계획을 배우게 된다.
  • ** 부분 작업 완료:** 운영자가 작업의 70%를 완료하고 객체가 떨어지고, 운영자가 복구하고 완료합니다. 정책은 작업 중 복구를 배우습니다.

교육과정 단계 L2에서 시작하여 실패 주사를 포함하십시오. L1 (정부 원시) 에서 실패는 희귀하고 정보적이지 않습니다. L2+에서 실패 복구는 생산 강도를 크게 향상시키는 중요한 기술입니다.

교육과정 설계 원칙

  • ** 원시적인 기술 (reaching, grasping) 를 시작하세요:** "object to object" 정책과 "stable object to grasp" 정책은 거의 모든 조작 작업의 기초입니다. 다 단계 작업으로 구성하기 전에 높은 역량을 (>95%의 성공) 훈련하십시오.
  • ** 복잡한 작업으로 구성:** 원시적인 기술이 훈련되면 복잡한 작업은 이미 관련 인식을 가진 기술과 운동적 부분능력을 가지고 있기 때문에 훨씬 더 빨리 학습됩니다. 정책에 도달하고 파악한 후에 훈련된 "배의 트레이" 작업은 구성을 배우는 데 300-500 개의 시범이 필요합니다. 처음부터 훈련하는 것은 2,000-5,000이 필요합니다.
  • ** 과제 간 재사용 시범:** 원시 기술 시범은 이러한 기술을 필요로 하는 모든 과제에 대한 사전 훈련 데이터로 재사용될 수 있습니다. 이것은 고품질 원시 기술 시범을 수집하는 비용을 절감합니다.
  • ** 원시적인 기술 품질을 엄격하게 측정하십시오:** 원시적인 기술은 80% 정도만 작동하면 구성된 작업에서 나쁜 결과를 초래합니다. 구성에 진입하기 전에 각 원시적인 작업에 95% 이상의 성공을 목표로합니다.

작업 분해 전략

복잡한 조작 작업은 모든 원시적인 행동으로 분해될 수 있습니다. 분해는 교육과정을 어떻게 구성하고, 시범 예산을 할당하고, 정책을 구성하는지를 결정합니다. 구현 복잡성에 따라 세 가지 분해 전략:

전략 1: 순서적 원시 (최소소소)

과제를 명확한 전달 조건으로 하나씩 실행되는 원시의 고정된 순서로 분할합니다.

  • ** 예제
  • 수준상태: 각 원시형은 성공상태를 선언한다 (예를 들어, 지갑이 닫힌 상태 및 GRASP에 대한 지갑력 > 2N). 다음 원시형은 전의 성공이 끝나면만 시작된다.
  • ** 장점:** 디버깅이 쉽다 (실패는 원시로 로컬링된다), 각 원시들은 독립적으로 훈련될 수 있으며 원시들은 재사용이 가능하다.
  • ** 제한:** 엄격한 순서화는 순서가 맥락에 의존하거나 원시물들이 시간에 따라 겹치는 작업을 처리할 수 없습니다.

전략 2: 계층적 정책 (중중소)

고위정책은 현재 관찰에 따라 실행할 원시적인 것을 선택한다. 원시적인 것은 사전 훈련되어 있으며, 전체 작업에 대한 훈련은 고위정책에만 있습니다.

  • ** 예제 분류 작업:** 고위 수준의 정책은 현장을 관찰하고, 다음 분류하는 객체를 식별하고, REACH → GRASP → PLACE_BIN_A 또는 REACH → GRASP → PLACE_BIN_B를 선택합니다.
  • ** 훈련:** 모든 원시들을 독립적으로 미리 훈련시켜 (교육과정 단계 L1-L2) 다음으로, 원시적인 선택이 아닌 원시적인 공동 명령이 있는 전체 분류 작업의 시범으로 고급 정책을 훈련시켜야 한다.
  • ** 장점:** 변수 길이의 과제와 조건부 분할을 처리합니다. 고급 정책은 종합 교육보다 훨씬 적은 시범 (50-200) 를 요구합니다.

전략 3: 교육과정 전공 교육 (최고 유연)

전체 작업에 대한 단일 엔드-투-엔드 정책을 훈련시키지만, 원시 기술 훈련에서 시각적 앵코더와 액션 디코더 무게를 초기화하십시오.

  • ** 프로세스:** (1) 영상 코더 무게를 추출하여 원시 기호를 훈련하십시오. (2) 원시 코더로 풀 탭 정책을 초기화하십시오. (3) 전체 작업의 시범을 정렬하십시오.
  • ** 이점:** 명시적인 전달 조건이 없습니다. 정책은 암시적인 전환을 학습합니다. 대부분의 자연스러운 움직임 품질.
  • ** 제한:** 실패가 발생했을 때 디버깅이 더 어렵습니다. 전략 2보다 더 많은 풀타스 시범이 필요합니다.

작업 난이도 레벨 L1-L5

Level Task Description Examples Demo Requirement Key Challenge
L1 — Primitive single-step Top grasp of flat, stationary object in fixed position Pick flat block, open/close gripper on fixed peg 50-200 Precise approach trajectory
L2 — Varied grasp Grasp objects with varied size, position, or orientation Pick cylinder of varying diameter, grasp in +/-30 deg orientation range 500-1,000 Visual generalization
L3 — Two-step manipulation Sequential actions with state dependency Pick and place, open box lid then insert item 1,000-5,000 State estimation between steps
L4 — Contact-rich assembly Precise insertion, assembly under uncertainty USB plug insertion, snap-fit assembly, nut threading 5,000-20,000 Reactive force control
L5 — Bimanual deformable Two arms, deformable objects, long horizons Fold towel, bag groceries, cut with knife and fork 20,000+ Bimanual coordination, deformable state

이러한 범위는 트랜스포머 기반의 현대 모방 학습 아키텍처 (ACT, Diffusion Policy) 를 가정한다. 오래된 행동 복제 방법은 같은 작업에 2-5배 더 많은 시범을 필요로 한다. pi-0와 같은 새로운 아키텍처 또는 대규모 사전 훈련된 시각 언어 행동 모델을 사용하는 경우, 사전 훈련 된 전례로 인해 L1-L3에서 시범 요구 사항은 3-10배 낮을 수 있습니다.

교육과정 단계별로 시범수표 스케일링

시범 예산은 교육과정 단계마다 비선형 확장 패턴을 따라야 한다. 첫 번째 단계에는 비교적 적은 시범이 필요하지만, 다음 단계마다 작업 복잡성이 증가하기 때문에 비례적으로 더 많은 시범이 필요합니다.

Curriculum Stage Demos (Without Curriculum) Demos (With Curriculum) Savings Success Threshold to Advance
L1 — 도달 거리 + grasp (fixed) 100-200 100-200 0% (baseline) 95%
L2 — Varied grasp 500-1,000 300-600 30-40% 90%
L3 — Pick-place sequence 2,000-5,000 800-2,000 50-60% 85%
L4 — Contact assembly 10,000-20,000 4,000-8,000 50-60% 80%
L5 — Bimanual deformable 20,000-50,000 8,000-20,000 50-60% 75%

주요 통찰력: 교육과정에서 가장 높은 비율의 저축은 L3-L5입니다. 바로 그 곳에서 시범이 가장 비싸다. 시범당 $25-$80 (RCSV 데이터 서비스 가격) T1) 은 교육과정 접근 방식이 직접 훈련에 비해 전형적인 L4 작업에 $50K-$200K을 절약합니다.

조작 교육과정: 선택, , 삽입

이 작업된 예제에서는 생산 조립 작업에 대한 완전한 교육과정을 보여줍니다. 구성 요소를 주택에 삽입하는 것입니다. 최종 작업은 L4 (접촉 부가적인 삽입) 이다. 그러나 교육과정은 먼저 L1-L3 단계를 통해 쌓인다.

단계 1: 구성 요소 (L1) 를 달성 - 150 개의 디모

팔을 훈련시켜 집 위치에서 구성 요소보다 3cm 높게 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는 꽉 차 있는

  • 하드웨어: OpenArm 1 (6-DOF, 500g 유용 부하) 손목 장착된 RealSense D405
  • 데이터 속도는: 손목 카메라에서 30 Hz 관절 위치 + 60 fps RGB
  • 출력 형식: HDF5 /observations/qpos [6], /observations/images/cam_wrist [480x640x3], /action [6]
  • 평가: 20개의 실험, 목표 > 95%의 성공

2단계: 그래프 컴포넌트 (L2) - 400개의 데모

기 전부터 기 닫힌 기까지 뻗어 있다. 구성 요소의 위치는 15cm x 15cm 내에서 다양하다. 세 구성 요소 크기가 (소형, 중형, 큰) 이다. 성공: 5cm를 떨어뜨리지 않고 들어올리면서 확인된 안정적인 기.

  • 1 단계 중량에서 시각적 코더를 초기화
  • 10%의 포착 및 포착 실패 시범을 포함합니다
  • 평가: 모든 변종에 50개의 실험, 목표 > 90%의 성공

3단계: 교통 및 조선 (L3) - 800개의 시범

입구점 위에 배치된 부품을 선택하고, 가구로 운송하고, 삽입점 위에 배치한다. 성공: 입구축의 2mm와 3도 내에 배치된 부품.

  • 단계 2 중량에서 초기화 (코더 + 액션 디코더)
  • 10cm x 10cm 내의 다양한 가구 위치
  • 15%의 중심에서 벗어나 올바른 접근을 위한 시범을 포함합니다
  • 평가: 50개의 실험, 목표 > 85%의 성공

단계 4: 부착 구성 요소 (L4) - 2,000 개의 디모

힘 조절으로 완전 삽입. 관찰 공간에 F/T 센서 데이터를 추가. 성공: 부품이 완전히 앉아 (F/T 센서는 좌석 힘의 서명을 감지한다).

  • 단계 3중중에서 시작하여 네트워크에 F/T 관찰 지부를 추가합니다
  • 손목 F/T 센서 (T3) 를 사용하여 100 Hz에서 30 Hz에서 시각과 함께 수집합니다.
  • 20%의 회복 시범을 포함하고: 잘못된 조율 접근, 힘 피드백을 통해 수정
  • 평가: 100개의 실험, 목표 > 80%의 성공

** 교육과정과 함께 하는 총:** 3,350개 시범. ** 교육과정 없이 하는 총:** 10,00020,000개 시범. 비용 절감: $40/시범: $266K$666K 절약.

각 단계 에서 평가 측정

각 교육과정 단계에는 단순한 성공/실패를 넘어 구체적인 평가 매트릭이 필요합니다. 이러한 매트릭은 정책이 발전할 준비가 되어 있는지 아니면 더 많은 데이터가 필요 있는지 진단합니다.

Metric What It Measures Target Stage Applicability
Success rate Binary task completion 75-95% (by stage) All stages
궤적 smoothness (jerk) Third derivative of joint positions; lower = smoother <2x demonstration average L1-L3
Positional accuracy End-effector error at target pose <5 mm for L1-L2, <2 mm for L3-L4 L1-L4
에피소드 duration variance Consistency of task execution timing CV < 0.3 L2-L5
Force regulation error Deviation from target contact force +/- 1 N of target L4-L5 only
Bimanual sync error Timing offset between left and right arm actions <50 ms L5 only
일반화 gap Success rate on held-out object positions vs. training positions <10% drop L2-L5

모든 평가 데이터를 [RCSV 데이터 플랫폼]T4에 업로드하여 자동화된 측정 계산 및 교육과정 단계별 트렌드 추적을 할 수 있습니다.

기술 분해 예제

컵을 쌓는 작업 (L3) 을 생각해 보십시오. 컵을 들고 두 번째 컵에 쌓아 놓습니다. 이 작업은 세 가지 재사용 가능한 기술로 분해됩니다.

  • ** 접근 능력:** 컵 손잡기 영역에서 2cm 이내에 최종 효과기를 이동하여 접근 각도가 올바르게 한다. 100-200 개의 디모를 사용하여 독립적으로 훈련된다. 컵 잡기 작업에 재사용된다.
  • ** 기 능력:** 기 자세에서 컵에 기를 닫아 기 위치 피드백을 통해 기 성공을 확인한다. 50-100 Demo (기능 무게에서 초기화) 로 훈련된다. 모든 컵 처리 작업에 재사용된다.
  • ** 칸의 실력:** 칸의 실력:** 칸의 실력:** 칸의 실력:** 칸의 실력:** 칸의 실력:** 칸의 실력:** 칸의 실력:** 칸의 실력:** 칸의 실력:** 칸의 실력:** 칸의 실력:** 칸의 실력:** 칸의 실력:** 칸의 실력:** 칸의 실력:** 칸의 실력:** 칸의 실력:** 칸의 실력:** 칸의 실력:** 칸의 실력:** 칸의 실력:** 칸의 실력:** 칸의 실력:** 칸의 실력:** 칸의 실력:** 칸의 실력:** 칸의 실력:** 칸의 실력:** 칸의 실력:** 칸의 실력:** 칸의 실력:

교육과정: 450-800개 시범. 교육과정 없이 총 2,000-5000개 시범. 교육과정에서는 이 작업에 대한 데이터 요구사항을 4-6배 줄인다.

과제 들 사이 에 학습 을 옮기십시오

현대 정책 아키텍처는 관찰 공간에서 시각적 인 앵코더를 공유합니다. 이 앵코더는 이미지에서 작업 관련 기능을 추출하는 것을 배우습니다. 커리 ?? 럼을 통해 다양한 작업에 대한 앵코더를 훈련하면 새로운 작업에 더 효과적으로 전송되는 더 풍부한 표현을 개발합니다.

  • ** 공유 시각 코더:** 모든 교육과정 작업에 단일 ResNet-18 또는 ViT 작은 코더를 공동으로 훈련하십시오. 이 코더는 많은 작업에 유용하게 사용되는 "물질 가장자리", "지리퍼 근접성" 및 "잡기 접촉" 같은 기능을 학습합니다.
  • ** 교육과정과 함께 샘플 효율성 3x:** 경험적으로, 교육과정 전개된 시각 코더는 새로운 L3 작업의 시범 요구 사항을 2,000 개의 시범 작업에서 약 600-700 개의 시범 작업으로 줄여 대략 3x 샘플 효율성 향상.
  • ** 정렬 전략:** 새로운 작업에 있어서, 코더 무게를 교육과정에서 동결하고 (또는 낮은 학습률을 사용) 새로운 작업의 시범에 대한 행동 디코더만 훈련시켜 새로운 작업을 학습하는 것을 방지합니다.

교육 계획 을 언제 생략 해야 합니까?

교육과정 설계는 시간이 필요하며 복잡한 작업만 해주는 것 입니다. 모든 프로젝트가 그것을 보장하지는 않습니다.

  • L1-L2 과제: 직접 진행. 간단한 단일 단계 또는 다양한 랩 작업은 100~1,000 개의 데모에서 끝에서 끝으로 훈련될 수 있습니다. 교육과정을 설계하는 전반적인 비용은 저축을 초과합니다.
  • L3 과제: 상황에 따라 달라진다. 만약 당신이 명확한 기술 분해가 있고 다른 프로젝트에서 이미 원시적인 기술 데이터를 가지고 있다면, 교육과정을 사용하십시오. 만약 당신이 한 L3 과제를 처음부터 시작한다면, 직접 훈련은 종종 더 빨라집니다.
  • L4-L5 과제: 교육과정은 필수적이다. 교육과정을 하지 않고 직접적으로 초등부터 접촉이 풍부한 집합이나 양동력 과제를 훈련시키려는 시도는 비용이 많이 들며 대개 실패한다. 이 수준에서 교육과정을 설계하는 노력은 충분히 정당화된다.
  • ** 사전 훈련된 VLA를 이용한다:** 당신이 사전 훈련된 시각 언어 행동 모델 (RT-2, Octo, pi-0) 을 정렬하고 있다면, 모델은 이미 상당한 사전 지식을 가지고 있다. 교육과정은 여전히 도움이 될 수 있지만 기본 성능은 훨씬 더 높고 격차를 줄인다.

데이터 수집 순서

교육과정 순서대로 데이터를 수집합니다. 교육 시작 전에 모든 작업 데이터를 수집하지 않습니다. 이것은 더 어려운 작업 시범을 수집하는 데 초기 작업 정책을 출발점으로 사용할 수 있습니다.

  • L1 데이터를 먼저 수집: L1 정책의 성공률이 95%를 넘어서도록 훈련시켜라. 이 정책들은 이제 L2/L3 데이터 수집을 위한 접근 궤도를 자율적으로 수집할 수 있습니다 (운전자는 접촉 근처에서 수정, 전체 접근이 아닙니다).
  • ** 데이터 증강을 위한 훈련된 정책을 사용:** 훈련된 접근 정책은 접근 단계를 자율적으로 수행할 수 있고, 인간 운영자는 포착 단계부터 텔레오퍼레이션을 수행할 수 있습니다. 이것은 운영자의 인지 부하를 줄이고 더 일관된 시범을 생성합니다.
  • ** 초기 단계에서 속도보다 일관성을 우선시하십시오:** L1 및 L2 시범은 느리고 의도적으로 실행되어야 합니다. 정책은 데이터로부터 대략적인 속도를 배울 것입니다
  • 간격 훈련 및 수집: 100~200개 시범시험 후마다 체크포인트를 훈련시키고 평가합니다. 정책이 정평화되고 있다면, 단순히 더 많은 시범시험 (새로운 물체 위치, 조명 조건) 를 수집하는 것이 아니라, 더 다양한 시범시험을 수집합니다.

교육과정 설계 체크리스트

  • 최종 목표 과제 및 그 성공 기준을 정확하게 정의
  • L1에서 목표 수준까지 3-5 단계의 교육과정으로 분해
  • 단계별 시범수표 예산을 지정하십시오 ( 위의 스케일 테이블을 사용하십시오)
  • 각 단계에 대한 평가 매트릭과 진급률을 정의한다
  • L2 단계 이상에서 10-20%의 계획 실패 주입
  • 수집 시작 전에 단계별 추적을 위해 [데이터 플랫폼]를 설정합니다
  • 계획보다 더 많은 시범이 필요한 단계에 대한 예산의 20%를 예비으로 할당한다
  • 단계 간 코더 중량 전송 전략을 계획 (결제와 미세조)
  • 각 단계 전에 작업에 대한 요구 사항에 대한 일정 운영자 교육을 실시
  • 검토 시퀀스를 설정: 단계 끝에서만 아니라 200개 시범시험에 한 번 체크포인트를 평가한다

관련 가이드

RCSV와 작업

RCSV는 로봇 학습 프로젝트의 종말부터 종말까지 교육과정 설계 및 실행을 제공합니다. 우리 팀은 L1 단일 단계 포착에서부터 L5 쌍방향 변형 가능한 객체 조작에 이르기까지 조작 작업에 대한 교육과정을 설계하고 실행했습니다.

  • ** 교육과정 컨설팅:** 우리는 어떤 데이터 수집이 시작되기 전에 당신의 목표 작업을 검토하고 교육과정 구조를 제안하고 시범 예산을 추정합니다.
  • ** 데이터 수집 실행:** 샌프란시스코, CA알스턴, MA 시설에서 인증된 사업자는 OpenArm 1, DK1 쌍용서, Unitree G1 및 5+ 추가적인 팔 플랫폼에서 교육 과정 단계 데이터를 수집합니다.
  • ** 플랫폼 통합:** 수집된 모든 데이터는 RCSV 데이터 플랫폼 에 단계별 매트릭, 평가 대시보드 및 HDF5/LeRobot/RLDS에 포맷 수출을 통해 업로드됩니다.
  • ** 하드웨어 임대:** 내부 교육과정을 실행하기 위해 하드웨어가 필요합니까? [임대 로봇]

훈련 자료 를 구축 하십시오

RCSV 데이터 서비스들은 로봇 학습 팀들을 위한 교육과정에 대한 데이터 수집 인프라, 운영자 훈련, 데이터 세트 품질 분석을 제공합니다.

데이터 서비스를 탐구 전문가와 이야기