실체로 시미스 전송 설명: 현실 격차, 도메인 적응, 앞으로의 길
로봇의 실체적 이동에 대한 깊은 몰입: 현실 격차, 시뮬레이션 충실성 수준, 도메인 적응 방법, 돌파구 역사, 그리고 2026년에 이 분야가 어디로 가고 있는지
로봇을 시뮬레이션으로 훈련시키고 실제 하드웨어에 배치하는 것은 로봇 분야에서 가장 매력적인 아이디어 중 하나입니다. 무한한 데이터, 하드웨어의 고장률, 수천 개의 사례에서 병렬 훈련을 합니다. 하지만 시뮬레이션과 현실 사이의 격차는 깊은 뿌리를 가지고 있습니다. 그리고 그것을 닫는 것은 물리 엔진, 렌더링, 기계 학습, 시스템 식별에 수십 년의 발전이 필요했습니다. 이 기사에서는 역사를 추적하고 이론을 설명하고 최신 기술을 지도로 표시합니다.
현실 격차: 왜 시뮬레이션 이 현실 이 아닌지
모든 물리 시뮬레이터는 대략적인 결과를 만들어냅니다. 고체 역학은 수학적 오류를 도입하는 단시간 통합기치로 모델링됩니다. 접촉력은 페널티 방법이나 제약 해제기를 사용하여 계산됩니다. 이는 실제 세계에서 견본이 없는 유물을 생성합니다. 침투, 진동, 비현실적인 복원. 재료 속성 (토화, 딱딱함, demping) 은 복잡한 비선형, 상태 의존적 물리적 현상을 단순화하는 척도 매개 변수로 지정됩니다. 액추아터는 반작용, 케이블 스트레칭, 열 유동 또는 가동 없이 이상적인 토크먼트 원천으로 모델링됩니다.
시각적인 측면에서 렌더링 이미지는 실제 카메라 이미지와 인간에게 보이지 않지만 신경망에 중요한 방식으로 다릅니다. 방사선 추적 그림자는 실제 환경의 미묘한 환경 폐쇄성이 없습니다. 실제 표면의 완전한 복잡성을 포착 할 수 없는 BRDF 모델에 의해 물질 반사율이 대략됩니다. 카메라의 노이즈 모델은 실제 센서의 노이즈 특성에 완벽하게 일치하지 않습니다. 이러한 시각적 불균형은 학습된 시각적 특징을 사용하는 정책에 특히 문제가 있습니다. 왜냐하면 특징은 렌더링이 잘못되는 배포 특성에 민감하기 때문입니다.
이러한 개별 추대화의 합성 효과는 현실 격차를 만듭니다. 시뮬레이션에서 95%의 성공률을 달성하는 정책은 실제 하드웨어에서 20%까지 떨어질 수 있습니다. 격차는 단 하나의 것이 아닙니다. 그것은 동적, 감지, 제어의 수십 개의 작은 부합의 축적 효과입니다.
실제 시미 연구 의 짧은 역사
시뮬레이션에서 실제로 전송하는 것은 로봇 학습의 초기부터 연구 주제로 왔습니다. 1990년대와 2000년대, 남부 캘리포니아 대학교와 독일 항공우주센터의 팀은 시뮬레이션에서 실제 로봇으로 간단한 접근 및 포착 정책을 전송하는 것을 입증했지만, 결과는 정확한 물리 모델링이 중요하지 않은 작업에 제한되었습니다.
이 분야는 2017년, OpenAI가 로봇의 숙련된 조작 작업에 대한 도메인 무작위화를 시술하면서 큰 발전을 거뒀습니다. 핵심 혁신은 훈련 배포에서 실제 세계가 단지 또 다른 샘플이 될 정도로 광범위한 범위에서 시뮬레이션 매개 변수 (토열, 질량, 액추에이터 이득, 시각적 외모) 를 무작위로 분류하는 것이었다. 토빈 등이 "시뮬레이션에서 실제 세계로 깊은 신경망을 전송하기 위한 도메인 무작위화"로 발표한 이 연구는 다음 몇 년 동안 기본 접근법으로 도메인 무작위화를 확립했습니다.
2019년, OpenAI는 이 접근 방식을 더 복잡한 작업으로 확장했습니다.
2020년부터 2024년까지, 다리 로봇 커뮤니티는 시미트-트리얼 전송으로 가장 일관된 실용적인 성공을 달성했습니다. ETH 취리히 (ANYmal), MIT, 카네기 멜론, 그리고 Unitree 및 Agility Robotics와 같은 상업 회사에서 다양한 지형에서 실제 네발과 두발에 강력한 이동을 수행하는 시뮬레이션에서 완전히 훈련된 정책을 보여주었습니다. 이러한 성공은 특권 정보 훈련, 신중한 시스템 식별, 그리고 표준 딱딱한 몸 시뮬레이터에서 이동 동력을 잘 모델링한다는 사실에 의존했습니다.
시뮬레이션 충실성 수준
시뮬레이션 속성은 스펙트럼에서 존재하고 시뮬레이터가 떨어지는 곳을 이해하는 것은 전송이 얼마나 어려울지 예측하기 위해 필수적입니다.
** 낮은 충실** 시뮬레이션은 단순화된 동적 (점량 모델, 운동형 모델) 과 기본 렌더링 (강한 색상, 그림자 없다) 을 사용한다. 이들은 알고리즘 개발 및 테스트에 유용하지만 거의 전송 가능한 정책을 생성하지 않는다. 예: 간단한 OpenAI 체육관 환경, 조정된 매개 변수 없이 기본적인 PyBullet 설정.
** 중간 충실** 시뮬레이션은 정렬된 접촉 매개 변수와 합리적인 (하지만 사진현실적이지 않은) 렌더링을 통해 정확한 딱딱한 신체 역학을 사용합니다. 이 곳에서 가장 성공적인 시미-실적 전송이 발생합니다. 예를 들어, 시스템으로 식별된 매개 변수를 가진 잘 구성된 MuJoCo 환경, 캘리브러드 물리학을 가진 창세기 환경.
** 높은 충실** 시뮬레이션은 정확한 물리 모델링, 사진현실적 렌더링 및 상세한 센서 시뮬레이션을 통해 sim-to-real 간격을 최소화하는 것을 목표로 한다. 목표는 시뮬레이션을 너무 정확하게 만드는 것입니다. 도메인 무작위로 통과하지 않고 간격이 충분히 작습니다. 예: NVIDIA 아이작 시름, 캘리브레이션 자산, 검증된 접촉 모델과 맞춤 시뮬레이터. 고충성 시뮬레이션은 도메인 무작위화의 필요성을 줄이지만 자산 창출 및 물리 캘리브레이션에 상당한 엔지니어링 투자가 필요합니다.
실제에서 도메인 무작위로 중간 충실성 시뮬레이션은 대부분의 작업에 가장 좋은 비용-성과를 타협하는 접근법이다. 도메인 무작위로 격차를 다룰 수 없을 정도로 과제는 너무 민감할 때 또는 사진현실적인 시각적 정책이 필요할 때 높은 충실성 시뮬레이션은 정당하다.
도메인 적응 방법
** 도메인 무작위화 (DR) **는 지배적인 접근 방식으로 남아 있습니다. 핵심 통찰력: 실제 세계는 무작위화 분포에 속한다면 정책은 실제 세계 조건에 견고하게 있어야합니다. DR는 효과적이며 구현하기가 쉽습니다. 실제 세계 데이터가 필요하지 않습니다. 그 한계는 매우 광범위한 무작위로 학습 문제를 더 어렵게 만들고 최고 성능을 줄일 수 있다는 것입니다. 정책은 결코 만나지 못할 조건에 견고하게 만들어야 합니다. 이는 그것이 직면한 특정 조건을 활용할 수 있는 능력을 제한합니다.
** 시스템 식별 (SysID) **는 반대 접근 방식을 취합니다. 즉, 매개 변수를 무작위로 측정하는 대신, 정확하게 측정하고 시뮬레이션을 현실에 맞게 설정합니다. SysID는 정책에 대해 견딜 수 있도록 훈련하는 대신 격차를 직접 줄입니다. 한계점은 완벽한 시스템 식별이 실용적이지 않다는 것입니다. 일부 매개 변수는 측정하기 어렵거나 불가능하며, 실제 환경도 시간이 지남에 따라 변합니다. 실제로는 SysID는 독립적인 기술보다는 도메인 무작위 배포의 중심을 설정하는 데 사용됩니다.
** 도메인 적응**은 시뮬레이션 관찰을 실제 관찰처럼 (또는 반대로) 변형시키기 위해 기계 학습을 사용하여 일반적으로 생성적 적대적 네트워크 (GAN) 또는 변동적 자동 앵커 (VAE) 를 사용하여 사용합니다. 사이클GAN 기반의 시프-실현적 시각적 적응은 시각적 격차가 주요 장벽이 되는 작업에 대한 유망한 결과를 보여주었습니다. 한계점은 도메인 적응이 모델 복잡성을 추가하고 유물을 도입할 수 있다는 것입니다.
시뮬레이션에서 실제 정렬은 시뮬레이션에서 대부분의 정책을 훈련시키고, 작은 양의 실제 데이터에 정렬합니다. 이것은 시뮬레이션의 데이터 효율성과 실제 세계의 상호 작용의 충실성을 결합합니다. 효율적인 정렬 방법 (LoRA 스타일의 어댑터, 잔류 정책) 은 실제 데이터의 양을 줄여주면서 기술이 점점 더 인기를 얻고 있습니다. 시뮬레이션 전 훈련 후 50~200개의 실제 시범을 통해 정밀 조정하는 것은 종종 시뮬레이션 전 훈련과 실제 훈련 모두보다 더 좋은 성능을 발휘합니다.
** 특권 정보 (교수-학생) **는 기초적 진실 시뮬레이션 상태에 접근할 수 있는 교사의 정책을 훈련시키고, 그 후 실제 하드웨어에서 사용할 수 있는 관찰만을 사용하는 학생으로 그 행동을 유도합니다. 이것은 보상만으로보다 더 강력한 훈련 신호를 제공하며 이동 전송의 표준 접근법으로 자리 잡았습니다. 더 나은 디스틸레이션 기술이 등장함에 따라 조작에 대한 효과는 증가하고 있습니다.
실무에서 도메인 무작위화: 무작위화해야 할 것
도메인 무작위화는 개념적으로 간단하지만 어떤 매개 변수를 무작위화하고 어떤 범위에서 선택해야 하는지에 대한 신중한 선택이 필요합니다. 너무 적은 무작위화는 격차를 여깁니다. 너무 많은 무작위화는 학습 문제를 해결하기 어렵게 만듭니다.
시각적 무작위화
| Parameter | Randomization Range | Impact on Transfer |
|---|---|---|
| Object textures and colors | Random RGB values, random textures from ImageNet crops | High — prevents color-based overfitting |
| Lighting direction and intensity | 1-4 point lights, random position on hemisphere, 0.3-3.0x intensity | High — shadow patterns differ between sim and real |
| Camera position perturbation | +/- 2cm translation, +/- 3 degrees rotation | Medium — handles calibration error |
| Background texture | Random crops from texture datasets | Medium — table and background appearance varies |
| Camera noise model | Gaussian noise sigma 0-10, random cutout patches | Low-Medium — real cameras are noisy |
신체적 무작위
| Parameter | Typical Range | Critical For |
|---|---|---|
| Object mass | 0.5x-2.0x nominal | Grasping force, lifting dynamics |
| Friction coefficient | 0.2-1.2 (uniform) | Grasp stability, sliding tasks |
| 액추에이터 gains (Kp, Kd) | 0.8x-1.2x nominal | Joint tracking accuracy |
| Action delay | 0-40ms random | Communication latency mismatch |
| Joint damping | 0.5x-2.0x nominal | Arm dynamics accuracy |
| Contact stiffness | 1e3-1e5 N/m | Contact dynamics fidelity |
시뮬레이터 비교: 아이작시미 vs 무조코 vs 창세기
| Feature | NVIDIA IsaacSim/Lab | MuJoCo (DeepMind) | Genesis |
|---|---|---|---|
| License | Free (NVIDIA Omniverse) | Apache 2.0 | Apache 2.0 |
| GPU parallelization | 4,096+ envs on A100 | 256-512 (MJX on GPU) | 10,000+ envs on single GPU |
| Rendering quality | Photorealistic (ray-traced) | Basic (OpenGL rasterizer) | Good (differentiable renderer) |
| Contact physics | PhysX (good rigid body) | Best-in-class contact solver | Good (differentiable) |
| Differentiable | Partial | Yes (MJX) | Yes (full pipeline) |
| Deformable objects | FEM soft body, cloth | Basic tendon/muscle model | MPM, SPH, FEM |
| Community/ecosystem | Large (NVIDIA-backed) | Largest (research standard) | Growing (open-source) |
| Best for | Visual policies, industrial sim | Locomotion, contact-rich tasks | Differentiable sim, soft body |
RCSV의 RL 환경 서비스 는 [OpenArm 1]
영역 격차 측정: 양적 방법
영역 적응에 투자하기 전에 양적 차이는 측정하십시오.
** 분산 시프트 매트릭스:** 시뮬레이션과 실제 하드웨어에서 동일한 작업의 100 에피소드를 기록하십시오. 이미지 기능 분포 (
** 정책 전송 테스트:** 정책을 순전히 시뮬레이션으로 훈련시키고 실제 하드웨어에 배포하고 성공률 격차를 측정합니다. 도메인 무작위로 잘 캘리브된 시뮬레이션에서 작업 유형별로 다음과 같은 격차를 예상하십시오:
- 평면 지형에서의 이동: 5~15%의 격차 (sim 95% → 실제 80-90%)
- 딱딱한 물체 선택 장소: 15-30% 격차 (시 90% → 실제 60-75%)
- 정밀 삽입 (±1mm): 30-50% 간격 (sim 85% → 실제 35-55%)
- 변형 가능한 물체 조작: 40-60% 간격 (시 80% → 실제 20-40%)
최근 시미스-트리얼 결과: 실제로 작동 하는 것
다음 결과는 출판된 논문과 RCSV 내부 테스트에서 나온 결과로, 2025~2026년 실무 상태를 나타냅니다.
DexPBT (NVIDIA, 2023): IsaacGym에서 유능한 조작을 위한 인구 기반 훈련. 다양한 객체를 재편시키는 알레그로 손을 훈련 시켰습니다. Sim-to-real 성공률: 알려진 객체에서 78%, 신기적인 객체에서 45%. 핵심 기술은 4,096 개의 병렬 환경에서 대규모 도메인 무작위로 분류합니다.
DexMV (UC San Diego, 2023): 인간 손으로 만든 비디오 시범을 사용하여 현명한 조작을 위한 RL 훈련에 대한 지침을 제공하였다. 실세계에서의 투기, 위치 및 리오리엔트 작업에서의 성공: 60-75%.
유동 이동 (ETH 취리히/유닛리, 2024-2025): Go2의 네 번으로 Sim 훈련된 유동 이동 정책은 평면 지형에서 95%+의 성공, 중건 지형에서 85%, 도전적인 지형에서 70%를 달성합니다. 격차는 거의 전적으로 시뮬레이션이 잘 모델링하지 않는 지형 극단에 있습니다.
** 조작을 위한 하이브리드 시미-리얼 (Fisical Intelligence, 2025):** pi0는 대략적인 운동 기술을 미리 훈련하기 위해 시뮬레이션을 사용하며, 그 다음 작업당 50~200개의 실제 시범을 정비한다. 이 하이브리드 접근법은 실제 데이터 요구에 비해 5-10배 감소하여 시미-일 뿐이나 실제 훈련보다 높은 성공률을 달성한다.
시미-투-리얼 이 작동 하는 시 와 그렇지 않은 시
시메트-투-리얼은 다음과 같은 기능에 적합합니다
- 이동 및 항해 (강직 체 역학은 잘 모델링되어 있습니다)
- 자유 공간 팔의 움직임 계획 (진학적 전송이 완벽하게)
- 도메인 무작위화로 단단한 객체 포착 (차差는 다교할 수 있다)
- 기초 모델 척추를 가진 시각 사전 훈련 (비जुअल 격차는 추상화된다)
- 실제 데이터 정렬 전에 대략적인 행동 초기화
시메트-투-리얼 싸움:
- 변형 가능한 물체 조작 (복, 케이블, 음식)
- 엄격한 용인도와 함께 정밀 조립 (접착 모델 부합은 치명적입니다)
- 복잡한 접촉 역학 (중개, 절단, 지우) 을 가진 도구 사용
- 재료 특성에 따라 작업 (토화, 딱딱함, 표면 질감)
- 복잡한 접촉 그래프와 다중 객체 상호작용
2026 년 에 기술 의 상태
2026년 시미트-트리얼 풍경을 정의하는 몇 가지 트렌드는 다음과 같습니다.
** GPU 가 가속화된 규모 시뮬레이션.** NVIDIA 아이작 시మ్ 및 관련 도구는 단일 GPU 클러스터에서 수천 개의 병렬 환경으로 훈련을 가능하게 합니다. 이것은 이전에 금지적인 계산이 필요한 작업에 시뮬레이션에서의 강화 학습을 실용화 시켰습니다.
분리 시뮬레이션. 제네시스 및 브랙스 같은 시뮬레이터는 물리 엔진을 통해 기하급수 계산을 지원하여 시스템 식별, 궤도 최적화 및 정책 학습을 위한 기하급수 기반 최적화를 가능하게 한다.
생산 시뮬레이션. 대규모 생성 모델은 물리 기반 시뮬레이션을 보완하는 다양한 객체, 텍스처 및 조명 조건으로 현실적인 합성 훈련 데이터를 생성하는 데 사용됩니다. 1X 기술 및 물리 지능과 같은 회사는 생성 데이터 증강이 실제 세계 정책 성과를 크게 향상시킨다는 것을 입증했습니다.
기본 모델 통합. Sim 훈련 정책은 점점 더 인터넷 규모의 데이터에 미리 훈련된 기초 모델 시각 척추 (DINOv2, SigLIP) 를 사용한다. 이러한 척추는 시각 sim-현실 격차의 상당 부분을 다는 강력한 시각적 기능을 제공하며, 시뮬레이션 훈련은 처음부터 시각적 인 인식보다는 제어 정책을 배우는 데 집중할 수 있게 한다.
**2026년 가장 성공적인 팀들은 시미-리얼을 바이너리 선택으로 취급하지 않는다. 시뮬레이션을 초기 정책 훈련, 시스템 식별을 시뮬레이션을 기동하기 위해, 잔여 불확실성을 처리하기 위해 도메인 무작위화, 그리고 최종 정렬을 위해 작은 양의 실제 데이터를 사용합니다. 이 하이브리드 접근법은 작업 유형마다 지속적으로 최상의 결과를 제공합니다.
당신 의 접근 방식 을 선택 하는 것
로코모션 및 내비게이션 작업에 있어서 특권 정보 훈련과 도메인 무작위화와 함께 시뮬레이션이 명확한 승자가 된다. 동적은 잘 모델링되어 있으며, 접근 방식은 여러 그룹에 의해 검증되며, 실제 하드웨어에서 거의 시뮬레이션 성능이 달성된다.
딱딱한 객체 조작 (픽 앤 प्लेस, 푸싱, 기본 어셈블리) 에서 하이브리드 접근법은 가장 잘 작동합니다. 도메인 무작위로 미리 훈련 시뮬레이션, 50-200 실제 시뮬레이션에 미세한 조정이 이어집니다. 시뮬레이션은 다양한 훈련 데이터를 저렴하게 제공합니다. 실제 데이터는 접촉 모델 부합을 수정합니다.
접촉 부가 높은 정확성 작업 및 변형 가능한 객체에 대해서는 실제 데이터 수집을 우선시하십시오. 이러한 작업의 시미-실적 격차는 현재 도메인 적응 방법과 연결하기가 크고 어렵습니다. 초기 행동 탐구 및 보상 형성을위한 시뮬레이션을 사용하지만 실질적인 실제 데이터 수집을 계획하십시오. RCSV의 [데이터 서비스] (
[RCSV 하드웨어] (OpenArm 1, DK1, Unitree G1) (OpenArm 1, DK1, Unitree G1) 과 함께 일하는 팀들 (Our [RL Environment Service] (OpenArm 1, DK1, Unitree G1)) 에 대해, [RCSV Hardware] (RCSV Hardware] (OpenArm 1, DK1, Unitree G1) 은 [RCSV Hardware] (RCSV Hardware) (RCSV Hardware) (RCSV Hardware) (OpenArm 1, DK1, Unitree G1) 와 함께 일하는 팀들 (OpenArm 1, DK1, Unitree G1), [RL Environment Service] (RL 환경 서비스) [RL1T6
관련 독서
- [전용 데이터가 시뮬레이션을 왜 이겨주는가]
- 로봇 학습의 분포 정책 -- 실제 데이터와 시뮬레이션 데이터에 대한 교육
- [로봇 훈련 데이터는 무엇입니까?]
- Unitree G1 Review - 로코모션용 시프-투-리얼
- RCSV RL 환경 서비스 -- 사전 기량화된 시뮬레이션 환경
- RCSV 데이터 서비스 -- 정비용을 위한 실제 데이터 수집
- 사문 -- 도메인 무작위화, 시스템 식별, 그리고 더 많은







