왜 원격 수술 데이터가 여전히 로봇 훈련 정책에 대한 시뮬레이션을 이길 수 있습니까?
시뮬레이션의 발전에도 불구하고 실제 원격 조작 시범은 훈련 조작 정책의 금 표준이 남아 있습니다.
[전용사 안내]
[← 블로그]
sim-to-real 격차는 좁아지고 있지만 닫히지 않고 있으며 접촉이 풍부한 작업에서는 절대 완전히 닫히지 않을 수 있습니다.
지속 되는 시프-리얼 격차
시뮬레이션은 아주 먼 길을 걸었습니다. 아이작 연구소는 초당 수천 프레임으로 딱딱한 신체 물리학을 구현합니다. MuJoCo MPC는 밀리초에 조작 루프를 닫습니다. 하지만, 모든 팀이 단순히 시뮬레이션으로 훈련된 접촉이 풍부한 정책을 배포하려고 시도한 것은 동일한 벽에 도달했습니다. 실제 세계는 시뮬레이터가 예측하는 방식으로 행동하지 않으며,
핵심 문제는 접촉 모델링입니다. 로봇 손가락이 비누 바에 닿을 때, 접촉 딱딱함, 마찰 계수, 표면 미세 지리 모두 바가 슬라이드, 롤 또는 유지되는지를 결정하기 위해 상호 작용합니다. 시뮬레이션 엔진은 몇 개의 스칼라 매개 변수를 사용하여 이것을 대략적으로 나타냅니다. 습한 ABS 표면에 있는 실리콘 비누는 마찰 계수를 가지고 있으며, 회전 속도, 정상적인 힘, 표면 습도에 따라 현재 물리 엔진이 정확하게 모델링하지 못하는 방식으로 변한다. 시뮬레이션에 훈련된 정책은 실제 모델이 아닌 시뮬레이션된 접촉 모델을 활용하는 법을 배우게 된다.
접촉 부: 시뮬레이션 이 파악 할 수 없는 것
접촉 부가한 조작 작업
| Contact Property | Sim Fidelity | Real-World Complexity | Gap Severity |
|---|---|---|---|
| Static friction coefficient | Single scalar per pair | Varies with normal force, velocity, surface wear, moisture | High |
| Contact patch geometry | Point/line contact models | Deformable patch with pressure distribution | High |
| Surface micro-geometry | Not modeled | Micro-roughness, grain direction, surface coatings | Moderate |
| Soft body deformation | FEM or MPM (slow, approximate) | Viscoelastic, rate-dependent, non-linear | Very high |
| 액추에이터 dynamics | Idealized motor models | Backlash, cable stretch, thermal drift, gear wear | Moderate |
| Visual appearance under contact | PBR rendering (improving) | Specular reflections, shadows from gripper, occlusion | Low-moderate |
이러한 격차의 복합 효과는 접촉 작업의 sim-to-real 전송을 매우 어렵게 만드는 것입니다. 각 개별 근접은 작은 오류만을 가져올 수 있지만 마찰, 기하학 및 역학에서의 오류는 다 단계 접촉 순서 동안 복수적으로 복합됩니다. 접촉 모델링의 부정확성에서 5%의 단계별 오류가 있는 10 단계 삽입 작업은 시각 관측의 분포 변화의 회계를 하기 전에 0.95^10 = 60%의 전체 성공을
분배 변화: 양적 증거
배포 전환은 정책이 훈련 중에 볼 수 있는 국가 배포와 배포 중에 만나는 국가 배포 사이의 불합의를 의미합니다. 시뮬레이션 훈련 정책은 두 가지 다른 방식으로 배포 전환에 시달립니다:
** 시각 분포 전환:** 도메인 무작위화 및 신경 렌더링의 발전에도 불구하고, 시뮬레이션된 이미지는 실제 카메라 피드와 분포적으로 다릅니다. 이 변화는 측정할 수 있다. 아이작시엠에서 렌더링된 조작 장면과 같은 장면의 실제 리얼센스 촬영 사이의 FID (Frechet Inception Distance) 는 일반적으로 80-120, 다른 실제 카메라 설정 사이에서는 20-40입니다. 이 격차에 민감한 학습된 시각적 코더를 가진 정책은 시뮬레이션에서 실제로 전송할 때 15-30%의 성능 저하를 나타냅니다.
역학 분포 전환: 시각적 전송이 성공할 때에도 (분야 무작위화 또는 실제 이미지 렌더링을 통해) 역학 부합은 훈련 중에 정책이 본 적이 없는 배치 중에 상태 궤도를 만듭니다. sim 훈련 된 포착 정책은 시뮬레이터의 역학 모델에 의해 형성된 궤도에 있는 객체를 접근합니다. 실제로, 팔은 액추이터 모델링 오류로 인해 약간 다른 궤도를 따르고 있으며, 정책에 배포되지 않는 포착 접근 구성으로 이어집니다. 이 역학 전환은 측정하기가 어렵지만 접촉 작업에서 sim-to-real 실패의 대부분을 차지합니다.
인간 행진 이 올바른 분포 를 잡는 이유
숙련된 운영자는 로봇 팔을 원전으로 조작하여 비누줄을
이것은 텔레오퍼레이션 시범이 시뮬레이션이 쉽게 제공할 수 없는 두 가지를 암묵적으로 암호화한다는 것을 의미합니다: ** 올바른 작업 분포** (물질의 포즈, 포지션 전략 및 실제 물리 세계에서 작동하는 행동 순서 집합) 및 ** 암묵적 제한 만족** (전문적 운영자는 자신의 경험에 의해 실패할 것이라는 것을 결코 이해하려고 시도하지 않습니다.
종종 간과되는 세 번째 혜택은 다음과 같습니다. 간접적인 역학 정보. 운영자가 슬라이드를 느끼기 때문에 그 잡기력을 중간 궤도에 조정하면 실제 마찰 계수를 시범 궤도에 암호화합니다. 객체가 어색하게 위치하기 때문에 접근 속도를 늦추면 실제 운동적 제약을 암호화합니다. 이 동적 정보는 "자유"입니다. 그것은 모든 시범과 함께, 액션 순서에 내장되어 있습니다. 그리고 바로 시범 시범이 잘못되는 정보입니다.
작업 유형별 시프-리얼 격차: 양적 증거
시프에서 실제 간격의 크기는 작업 유형에 따라 크게 달라진다. 다음 데이터는 여러 하드웨어 플랫폼에서 발표된 벤치마크와 RCSV의 내부 평가에서 집계된다:
| Task Type | Sim Success | Real Success (Sim Policy) | Real Success (Teleop Data) | Demos Needed |
|---|---|---|---|---|
| Pick-place (rigid, top-down) | 95% | 75-85% | 90-95% | 100-200 |
| Peg-in-hole (1mm clearance) | 90% | 30-50% | 80-90% | 200-400 |
| Deformable manipulation (cloth) | 80% | 15-30% | 65-80% | 300-600 |
| Cable routing / insertion | 70% | 10-25% | 70-85% | 400-800 |
| Liquid pouring | 85% | 20-40% | 75-90% | 150-300 |
| Tool use (e.g., screwdriver) | 75% | 5-15% | 60-75% | 500-1000 |
패턴은 명확하다: 풍부한 접촉 역학이 있는 작업들은 sim-to-real 격차를 더 많이 나타냅니다. 상하급 고체 픽플레이스에서는 10-20 퍼센트 포인트
품질별 비용-비상 비교
실제 데이터 접근에 대한 일반적인 반대는 비용입니다. 시뮬레이션 데이터는 환경을 가지고 있으면 "자유"입니다. 실제 시뮬레이션에는 운영자, 하드웨어 및 시간이 필요합니다. 그러나 이러한 프레임링은 궁극적으로 정책 성과를 결정하는 시뮬레이션 품질의 비용을 무시합니다.
| Data Source | Cost/Demo | Demos for 80% Success | Total Cost to 80% | Time to 80% |
|---|---|---|---|---|
| Sim-only (Isaac Sim) | ~$0.001 | Often unreachable for contact tasks | N/A (ceiling ~50-60%) | 2-4 weeks sim engineering |
| Sim + domain rand (tuned) | ~$0.01 (compute) | 500K-1M episodes | $5K-10K compute + 4-8 weeks engineering | 4-8 weeks |
| Real teleop (in-house) | $15-30 | 200-400 | $3K-12K + hardware setup | 2-3 weeks |
| Real teleop (RCSV managed) | $8-16 | 200-400 | $2,500 pilot / $8,000 campaign | 1-2 weeks |
| Hybrid (sim pre-train + real fine-tune) | $0.01 sim + $10 real | 50K sim + 100-200 real | $2K-5K total | 3-4 weeks |
핵심 통찰력: 접촉 부가 있는 작업에 있어서 시뮬레이션만으로도 어떤 비용으로도 목표 성공률을 달성할 수 없습니다. 왜냐하면 성능 천장은 접촉 모델링의 충실함으로 제한되기 때문입니다. 실제 데이터는 목표에 더 빠르고 예측 가능한 방식으로 도달하고 관리된 수집 경로가 (RCSV의 [데이터 서비스]
시뮬레이션 이 실패 하는 3 가지 사례 연구
- 소프 바 포착: 산업 전반에 걸쳐 6개 팀이 아이작 시밍에서 기본 PBR 마찰 매개 변수를 가진 정책을 훈련한 결과 시뮬레이션에서 80% 이상의 성공을 거두었지만 실제 하드웨어에서는 <40%를 달성했다. 접촉 딱딱함 모델은 잘못되었다. 실제 텔레오퍼레이션 데이터로 전환하면 300개 시범에서 85% 이상의 성공률을 가져왔다.
- ** 케이블 삽입:** 변형형 기하학은 실시간 물리 엔진에서 본질적으로 해결되지 않습니다. 손가락 접촉 아래 USB-C 케이블의 변형은 특정
전, 재킷의 딱딱함 및 핵심 준수에 달려 있습니다. 케이블 라우팅 시뮬레이션 정책은 실제에서 약 20%의 성공을 달성합니다. 500 개의 데모를 가진 텔레오퍼레이션 훈련 정책은 70-80%를 달성합니다. - ** 액체 유출:** 물 한 잔의 규모에서 액체 역학 시뮬레이션은 SPH 또는 격자 기반 방법으로 계산적으로 처리할 수 있지만, 액체, 컵 림 기하학, 표면 긴장 사이의 상호 작용은 시프레이션 정책이 체계적으로 과잉 유출할 정도로 복잡합니다. 200 Demo의 텔레오퍼레이션 데이터 세트는 시뮬레이션에서 훈련된 50K 단계 RL 정책보다 뛰어난 정책을 생성했습니다.
실제 로 시뮬레이션 이 어떻게 제대로 되는 것 입니까?
이것은 시뮬레이션에 반대하는 주장이 아닙니다. 그것은 그것이 잘하는 것에 대해 시뮬레이션을 사용하는 주장입니다. sim이 진정으로 도움이 되는 세 가지 분야:
- ** 자유 공간 운동 계획:** 알려진 환경에서 충돌 없는 궤도 생성은 sim에서 실제로 잘 전달된다. 물질의 물리학 (강체 운동학) 은 정확하게 모델링된다.
- 다양한 장면 생성: 시뮬레이션은 수천 개의 객체 포즈, 테이블 구성 및 환경 레이아웃을 생성할 수 있으며 물리적으로 설정하는 데 몇 주가 걸릴 수 있습니다. 이 다양성은 시각적 표현을 미리 훈련시키는 데 귀중합니다.
- ** 거친 행동의 무한한 데이터 스케일:** 로봇이 대략적으로 목표, 객체에 접근하거나 통로를 탐색하도록 하는 것은 수백만 개의 시뮬레이션 에피소드에서 시작될 수 있습니다. 미세한 접촉 정책이 그렇지 않더라도 거친 행동이 전송됩니다.
- ** 시각적 인코더를 미리 훈련시키는 것:** 다양한 객체 외모, 조명 조건 및 카메라 관점으로 수백만 개의 시뮬레이션 장면에서 시각적 인 척추를 훈련시키는 것은 실제 카메라에 잘 전달되는 표현을 생산합니다. 이것은 오늘날 시뮬레이션의 가장 높은 ROI 사용입니다.
시뮬레이션 데이터 가 도움 이 되는 경우: 사전 훈련 사례
시뮬레이션 데이터에 대한 가장 강력한 주장은 주요 교육의 원천이 아니라 사전 훈련 단계로 있습니다.
1. 시각적 표현 사전 훈련. 1M 도메인 무작위화로 리스넷-50 또는 비트 척추를 훈련합니다. 결과적인 코더는 실제 카메라에 전송되는 객체 수준 특징 (사각, 모양, 공간 관계) 을 학습합니다. 200개의 실제 시범에서 정비하는 것은 처음부터 훈련하는 것과 비교해 3-5배 더 적은 반복을 필요로 하며, 그 결과 정책은 새로운 카메라 관점과 조명 조건에 더 잘 일반화된다.
2.
3. 실패 모드 발견. 10K 무작위 시나리오에서 sim 정책을 실행하고 실패 모드를 카탈로그로 나열하십시오. 이 카탈로그를 사용하여 실제 데이터 수집을 목표로 설계합니다.
하이브리드 접근법: 실용적 한계
2025년 가장 효과적인 팀은 sim와 real
**Sim 사전 훈련 + 실제 정렬 (표준 접근):**Sim에서 훈련, 100-500개의 실제 데모에서 정렬. sim 정책이 40-60%의 실제 성공을 달성하는 작업에 잘 작동합니다. 예상 개선: 정렬에서 20-40 퍼센트 포인트. pi0, OpenVLA 및 대부분의 VLA 기반 시스템은 작업 전문화를 위해 사용합니다.
**실제 척추 + 시మ్ 증강:**실제 데이터에 대한 기본 정책을 훈련하고, sim 데이터를 1: 3에서 1: 5실제:시ಮ್ 비율로 증강합니다. sim 데이터는 실제에서 수집하는 데 몇 주 걸리는 상태 공간 커버리를 제공합니다. 주요 요구 사항은: sim 장면은 시각적으로 현실적이어야하여 시각 코더가 sim를 실제에서 구별하는 법을 배우지 않습니다 (FID < 50을 임계로 사용하십시오).
** 탐구에 대한 시미 + 정밀화 위해 실제:** 어려운 작업에 대한 새로운 해결책을 발견하기 위해 RL를 시미에서 사용하십시오 (예를 들어, 도구 사용 전략, 재구성 순서). 발견 된 전략을 잇점 순서로 추출합니다. 그 다음 이러한 전략을 따르는 실제 시범을 수집하고 실제 정책을 훈련하십시오. 이 접근법은 SIM의 능력을 활용하여 수백만 개의 궤도를 탐구하면서 배치 중에 접촉 모델링 문제를 피합니다.
RCSV의 텔레오퍼레이션 접근법
RCSV의 데이터 수집 방법론은 실제 시범 데이터에서 신호-음악 비율을 극대화하기 위해 특별히 설계되었습니다. 우리의 접근법은 여러 가지 주요 방법으로 ad-hoc 텔레오프 수집과 다릅니다.
- ** 구조화된 변동 프로토콜:** 모든 시범을 하나의 장면 구성에서 수집하기보다는, 우리는 미리 정의된 그리드에서 객체 위치, 방향 및 장면 배경을 체계적으로 변경합니다. 이것은 데이터 세트가 단일 구성을 과도하게 표현하는 대신 일반화에 중요한 변동 축을 커버하는 것을 보장합니다.
- 운영자 계층 시스템: 주 1~2일 훈련 중인 주니어 사업자들은 L1 과제를 수집한다 (단순한 선택 장소). 성인 사업자들은 (1개월 이상의 경험) 는 L2 과제를 처리한다 (다단계 조작). QA 리드 (3개월 이상) 는 L3 과제를 처리한다 (정밀 삽입, 도구 사용). 이 작업 복잡성에 대한 사업자의 기술과 작업의 복잡성을 일치시키는 것은 각 난이도 수준에서 디모 품질을 극대화한다.
- 삼 게이트 품질 파이프라인: 모든 시범은 (1) 자동화된 유리스틱 검사 (속도 제한, 작업 공간 제한, 에피소드 길이는), (2) 50K+ 로 표시된 에피소드에서 훈련된 ML 기반 품질 분류자 및 (3) 10% 샘플링 비율로 인간 스포트 검사 검사를 통과합니다. 거부율은 일반적으로 15-25%, 최종 데이터 세트에 깨끗한 시범이만 입력되도록 보장합니다.
- ** 하드웨어 표준화:** 모든 수집은 동기화된 멀티 카메라 녹음으로 [OpenArm 1] (
T3 ) (4500 달러) 또는 DK1 쌍방향 설정을 사용하여 가산화, 표준화된 작업장에서 발생합니다. 이것은 다른 수집 설정을 통해 정책 교육을 저하하는 하드웨어 특정 소음을 제거합니다.
그 결과: RCSV에서 수집된 데이터 집합은 ACT 및 전파 정책 아키텍처에 대한 12개의 작업에 대한 비교를 바탕으로, ad-hoc 설정에서 수집된 동등한 크기의 데이터 집합보다 15-25% 더 높은 정책 성공률을 지속적으로 달성합니다.
올바른 정신 모델: 시메에서 거친, 실제에서 좋은
우리가 본 가장 효과적인 접근법은 2단계 전략입니다. 1단계에서는 시뮬레이션을 사용하여 광범위한 전선을 훈련시킵니다. 로봇은 물체에 접근하고, 포착 후보자를 추정하고, 수천 개의 객체 범주에 걸쳐 대략적인 선택 동작을 수행합니다. 이 단계는 단일 A100에서 하루 종일 실행될 수 있으며, 올바른 포착에서 10cm 이내에 얻을 수 있는 정책을 생성합니다. ~ 90%의 경우.
2단계에서는 특정 작업에 대한 200~500개의 실제 텔레오퍼레이션 시범을 수집하고, 이 실제 데이터에 대한 시뮬레이션 훈련 모델을 정밀하게 조정합니다. 조합은 일반적으로 시뮬레이션 방식이나 실제 방식보다 더 나은 성능을 발휘하며, 처음부터 훈련하는 것과 비교해 실제 데이터 요구량을 5-10배 감소시킵니다.
데이터 수집 작업에서 RCSV 관찰
RCSV에서 수십 개의 데이터 수집 프로젝트에서 우리는 지속적으로 ** 데이터 품질이 접촉 작업에 대한 데이터 양을 상회한다는 것을 관찰했습니다. 훈련된 사업자로부터 300명의 전문가들의 시범 사례가 접촉, 삽입 또는 표면 추적을 포함하는 작업에 대한 초보 사업자로부터 1,500개의 시범 사례를 능가합니다. 전문가 운영자는 본능적으로 정책을 혼란스럽게 하는 시범을 피합니다. 그들은 학습 알고리즘이 실제로 신호를 추출할 수 있는 일관된, 깨끗한 움직임을 사용합니다.
또한, 우리는 첫 200개의 시범이 대부분의 L2 복잡성 작업 (구조된 선택 장소) 에서 감소하는 수익을 나타낸다는 것을 관찰했습니다. 다음 300개의 시범은 새로운 객체 포즈를 위한 강도를 향상시킵니다. 500개 이상, 추가적인 개선은 새로운 객체 인스턴스 및 환경 변이를 도입하는 것을 필요로 합니다.
하이브리드 전략 을 실제 로 적용
새로운 조작 작업을 시작하는 팀에 대한 우리의 권장 접근법은: (1) 험한 행동 사전 훈련을 위한 시뮬레이션 환경을 구축하거나 다운로드하는 것, (2) 정책을 초기화하기 위해 50K-100K 시뮬레이션 단계를 실행하는 것, (3) 구조화된 데이터 수집 프로토콜을 통해 300-500 개의 실제 원격 조작 시범을 수집하는 것, (4) 정교한 조정, (5) 훈련되지 않은 3 가지 새로운 조건에서 평가하는 것. 이 파이프라인에서는 일반적으로 심프로그램만 적용하는 데 필요한 3~6개월보다는 4-6주 안에 배치 준비가 된 정책을 생산한다.
# 예제 하이브리드 파이프라인 (pseudocode) # 1 단계: Sim 사전 훈련 python train.py \ --data sim_dataset/ \ --epochs 100 \ --backbone resnet50 \ --domain-rand visual+physics \ --save checkpoint_sim.pt # 2 단계: 실제 정렬 python train.py \ --data real_teleop_dataset/ \ --epochs 50 \ --backbone resnet50 \ --resume checkpoint_sim.pt \ --lr 1e-4 \ # 낮은 LR를 정렬하기 위해 정렬하기 위해 정렬하기 위해 정렬하기 위해 정렬하기 위해 정렬하기 위해 정렬하기 위해 정렬하기 위해 정렬하기 위해 정렬하기 위해 정렬하기 위해 정렬하기 위해 정렬하기 위해 정렬하기 위해 정렬하기 위해 정렬하기 위해 정렬하기 위해 정렬하기 위해 정렬하기 위해 정렬하기 위해 정렬하기 위해 정렬하기 위해 정렬하기 위해 정렬하기 위해 정렬하기 위해 정렬하기 위해 정렬하기 위해 정렬하기 위해 정렬하기 위해 정렬하기 위해 정렬
오늘날 실제 시범 데이터를 수집하기 시작하는 팀들을 위해 RCSV의 [데이터 수집 서비스] (T4
관련 독서
- [로봇 훈련 데이터 가이드]
- [시민에서 실제로 전송]
- [로봇의 분포 정책]
- [데이터 수집 팀의 규모]
- [로봇 데이터 해상]
- [VLA 모델 설명]
- [데이터 서비스]
- [RCSV 플랫폼]
- [사문]
실제 로봇 시위를 모으기 시작
RCSV는 훈련된 운영자, OpenArm 1 하드웨어 및 로봇 시범 수집에 대한 완전한 품질 파이프라인을 제공합니다.
[데이터 서비스를 탐구]







