세계 로보틱스 모델: 왜 중요하고 어떻게 작동하는지
로봇 기술에 대한 세계 모델은 무엇일까요? 드림어, IRIS, TD-MPC2와 같은 학습된 동적 모델들은 상상력 기반의 계획, 시프-투-리얼 전송, 안전 검증 등을 통해 샘플 효율적인 로봇 학습을 가능하게 하는 방법을 알아보세요.
제리 허랑 · 2026년 4월 22일
세계 모델은 행동으로 미래의 상태를 예측하는 학습된 동적 모델입니다. 로봇이 실제 세계에서 실행하기 전에 상상 속에서 행동을 계획하고 탐구하고 검증할 수 있게 해줍니다. 그들은 빠르게 로봇 학습 스택의 중심 요소가 되고 있습니다. 모델 기반 방법의 샘플 효율성과 딥 러닝의 표현력 사이의 격차를 다는 것입니다. 이 기사 에서는 그 들 이 무엇 이며, 주요 건축물 들 이 어떻게 다르는지, 그리고 프로젝트 가 하나 를 필요로 하는 것 을 어떻게 결정 하는지를 설명 합니다.
세계 모델 은 무엇 입니까?
세계 모델은 데이터로부터 환경의 역학을 학습하는 신경망이다. 현재 상태 (또는 관찰) 과 행동을 고려하면 모델은 다음 상태, 보상, 그리고 선택적으로 에피소드가 종료되었는지 예측한다. 이것은 새로운 아이디어가 아닙니다. 모델 기반 강화 학습은 수십 년 동안 존재해 왔습니다. 하지만 딥러닝, 대규모 데이터, 그리고 현대적인 순서 모델링의 조합은 2020년부터 세계 모델들을 훨씬 더 잘 만들어냈습니다.
공식적으로, 세계 모델은 마르코프 의사결정 과정의 전환 함수 T
- 코더: 원시 관측 (사진, 자기 인식, 점 구름) 을 콤팩트한 잠잠한 표현 z_t로 지도합니다.
- 역학 모델: 현행 잠잠 상태 z_{t+1}와 액션 a_t를 고려하여 다음 잠잠 상태를 예측합니다. 이것은 세계 모델의 핵심입니다.
- ** 디코더 (Decoder):** 관찰을 재구성하고, 보상과 잠복 상태에서 에피소드 종료를 예측합니다. 이 신호는 훈련 신호를 제공하며 상상된 궤도 평가를 가능하게합니다.
세계 모델을 유용하게 만드는 핵심 속성은 일단 훈련되면 역학 모델을 상상 속에서 "부러울 수 있습니다". 실제 로봇을 만지지 않고 수천 개의 궤도를 시뮬레이션할 수 있습니다. 이것은 학습된 모델 내에서 계획, 정책 최적화, 안전 검증을 완전히 가능하게 합니다.
로봇 기술 은 세계적 모델 이 필요 하는 이유
모델 없는 강화 학습 (RL) 방법들인 PPO와 SAC는 시행착오를 통해 학습합니다. 이를 통해 수백만 개의 환경 상호작용이 공감해야 합니다. 시뮬레이션에서는 비용이 많이 들지만 실제 하드웨어에서는 실용적이지 않고 위험합니다. 세계 모델들은 이 근본적인 병목을 4가지 메커니즘으로 해결합니다.
1. 샘플 효율성
세계 모델은 실제 세계의 모든 상호작용에서 더 많은 학습 신호를 추출합니다. 세계 모델은 값 함수를 업데이트하기 위해 한 번 전환 (s, a, r, s') 를 사용하는 대신 훈련 데이터로 저장합니다. 모델이 충분히 정확하면 에이전트는 모델을 롤링함으로써 무제한 합성 경험을 생성 할 수 있습니다. 드림어 v3는 예를 들어, 모델이 없는 방법들이 50200M의 프레임을 필요로 하는 200K의 환경 프레임에서 아타리 게임을 학습합니다. 샘플 효율성 1001000배 향상입니다. 로봇에 있어서, 각각의 프레임이 실시간으로 하드웨어에 실제 사용량을 지불하고, 이 차이가 존재적입니다.
2· 계획과 관측
정확한 세계 모델로 로봇은 하나의 행동으로 참여하기 전에 후보 행동 순서를 평가할 수 있습니다. 학습된 역학 모델로 모델 예측 제어 (MPC) 는 다음과 같이 작동합니다: (1) N 후보 행동 순서를 제안, (2) 세계 모델을 통해 각각을 롤 आउट, (3) 예측된 누적 보상으로 각 궤도를 점수, (4) 최고의 궤도에서 첫 번째 행동을 실행합니다. 이 계획 루프는 모든 제어 단계에 반복되며, 로봇에게 반응 정책이 부족한 신중한 추론의 형태를 제공합니다.
3· 안전 검증
실제 로봇에 정책을 배치하기 전에, 당신은 위험 상태를 확인하기 위해 세계 모델을 실행할 수 있습니다. 충돌, 관절 제한 위반, 과도한 힘, 또는 작업 공간 경계 위반. 이것은 물리 시뮬레이션보다 빠르고 저렴합니다. 왜냐하면 세계 모델은 GPU를 통해 하나의 단계로 진행되며, 접촉 동화 해제자가 대상이 되지 않고 있습니다. 또한, 세계 모델은 실제 데이터로부터 학습하고 분석적으로 시뮬레이션하기 어려운 현상을 (케이블 역학, 부드러운 객체 변형, 센서 소음) 포착하기 때문에 수동 시뮬레이션보다 더 현실적입니다.
4. 시프로 실제 전송
실제 로봇 데이터에 훈련된 세계 모델들은 실제 동적과 본질적으로 일치하는 학습된 시뮬레이터로서 작용합니다. 시뮬레이션과 실제 사이의 불합동은 시뮬레이션 훈련된 로봇 정책의 지배적인 실패 모드입니다. 실제 데이터의 소박한 양의 (1-10 시간 상호작용) 를 이용한 세계 모델은 시뮬레이션하기 어려운 역학을 캡처할 수 있습니다. 케이블 라우팅, 변형 가능한 객체 조작, 다양한 표면에서의 마찰, 컴플라이언스 접촉. 정확한 세계 모델 내부에서 최적화된 정책은 MuJoCo 또는 아이작 시밍에서 훈련된 정책보다 더 적은 영역 격차를 가진 실제 로봇으로 전송됩니다.
주요 건축물
세계 모델 풍경은 빠르게 진화해 왔습니다. 로봇 전문가들에게 가장 중요한 건축물들이 있습니다.
꿈꾸는 사람 (v1, v2, v3) -- 하프너 등, 2020-2023
드림어는 가장 성숙하고 널리 사용되는 세계 모델 프레임워크입니다. 그것은 결정적인 반복적인 상태를 유지 (역사를 캡처) 하고 스토카스틱한 잠복 상태를 유지 (무확정성을 캡처) 하는 반복적인 상태 공간 모델 (RSSM) 을 학습합니다. 에이전트는 세계 모델의 상상된 궤도에 전적으로 배우-비평 정책을 학습하고, 초기 데이터 수집 단계 이후 실제 환경에서 RL를 할 필요가 없습니다.
드림어 v3 (2023) 는 몇 가지 주요 개선 사항을 도입했습니다. 매우 다른 보상 스케일과 함께 작업 중 보상 및 가치 정상화를 위한 시몰로그 예측, 분리된 잠정 표현 (32 개의 클래스 각각 32 개의 클래스 = 1024 차원 분리된 코드) 및 조정이 없이 150 이상의 작업에서 작동하는 통합된 하이퍼 파라미터 집합. 이것은 마인크래프트에서 다이아몬드를 처음부터 수집하는 세계 최초의 모델 에이전트입니다. 다양한 게임 상태에서 수백 개의 순차적인 결정을 필요로 하는 작업입니다.
로봇에 대해서는 Dreamer v3는 기본 출발점이다. 그것은 자연적으로 연속 제어를 처리하고, 소박한 GPU 예산 ( 단일 RTX 3090) 에 훈련하고, 실제 로봇 조작, 이동 및 탐색 작업에 성공적으로 적용되었습니다. 그것의 주요 한계는 긴 지평선 합성 오류입니다. 정확한 예측의 200+ 단계가 필요한 작업에, 상상된 궤도가 현실에서 유도됩니다.
IRIS -- Micheli et al., 2023
IRIS (Internal Speech 상의 자동 회귀와 함께 상상) 는 근본적으로 다른 접근 방식을 취한다: VQ-VAE를 사용하여 관찰과 행동을 분리된 토큰으로 토큰화하고, 이후 자동 회귀 트랜스포머로 공동 순서를 모델링한다. 세계 모델은 본질적으로 GPT 스타일의 다음 토큰 예측기입니다.
이 아키텍처는 큰 언어 모델의 확장 속성을 물려받습니다. 모델 크기와 데이터를 증가시키면서 예측 품질은 예측할 수 없을 정도로 향상됩니다. IRIS는 100K 환경 상호 작용을 사용하여 아타리 게임 26개 중 10개에서 초인적 성능을 달성했습니다. Dreamer v3와 비교할 수 있지만 확장성이 더 높은 아키텍처입니다.
VQ-VAE를 통한 토큰화로 인해 손실 압축이 이루어진다. 정확한 조작에 중요한 미세한 공간 정보는 (중개체의 정확한 위치, 연결체의 방향) 이 분리된 병목에서 손실될 수 있다. 미리미터 미만의 정확성을 필요로 하는 로봇 작업에 대해서는 이것은 진짜 문제이다. 탐색, 이동 및 거친 조작에 있어서, 토큰화된 표현은 충분하며 확장 속성은 매력적입니다.
TD-MPC2 -- Hansen et al., 2024
TD-MPC2 (모델 예측 제어의 시간차별 학습, 버전 2) 는 추론 시 모델 예측 제어와 학습된 잠자연 역학 모델을 결합한다. 상상력에서 별도의 배우-비평가를 훈련시키는 Dreamer와 달리 TD-MPC2는 모델 예측 경로 통합 (MPPI) 알고리즘을 통해 온라인 계획에 직접 세계 모델을 사용합니다. 각 제어 단계에서는 액션 시퀀스를 샘플링하고 동적 모델을 통해 롤링하고 학습된 값 함수를 사용하여 점수를 받고 가장 좋은 첫 번째 행동을 실행합니다.
TD-MPC2의 핵심 기여는 단일 하이퍼 파라미터 집합과 단일 모델 아키텍처가 로코모션, 조작 및 탐색을 아우르는 104 개의 연속 제어 작업을 해결할 수 있음을 보여줍니다. 모델은 공동으로 학습된 코더, 역학, 보상 및 가치 함수와 함께 간단한 MLP 기반의 잠그림 역학 모델을 사용합니다. 이 단순성은 훈련과 추론을 빠르게 합니다.
로봇에 대해 TD-MPC2는 세계 모델이 별도의 정책으로 유통되는 대신 계획으로 직접 제어하도록 원한다면 설득력 있습니다. MPPI 계획 루프는 자연스럽게 역학 모델을 재교육하지 않고 변화하는 목표를 처리합니다. 이것은 목적이 배치 시간에 변화하는 작업에 적합합니다. 다른 목표 위치, 다른 포착 요구 사항 또는 인간에 의해 정해진 목표.
유니시미 -- 양 등, 2024
유니시미는 행동에 따라 좌우된 미래의 관측의 현실적인 비디오를 생성하는 "유니시미"입니다. 비디오 전파 모델 아키텍처에 기반하여 단일 모델에서 다양한 환경을 (내장, 야외, 조작, 탐색) 시뮬레이션 할 수 있습니다. 핵심 통찰력은 인터넷 규모의 비디오 데이터에는 암시적인 물리학이 포함되어 있습니다. 물체가 떨어지고, 액체가 흐르고, 문이 흔들리는 것. 그리고 충분히 큰 생성 모델은 이러한 역학을 명백한 물리학 감독 없이 배울 수 있습니다.
유니시마는 잠자리 공간보다는 픽셀 공간에서 작동하므로 직접 해석 가능한 사진현실적인 미래 프레임을 만들 수 있습니다. 이것은 계획된 궤도들에 대한 인간 검사 및 하류 비전 기반 정책을 훈련하는 데 유용합니다. 하지만, 픽셀 공간 생성은 계산적으로 비용이 많이 들며, 256x256의 16 프레임 롤러우트를 생성하는 데는 A100에서 2초 정도 소요되며, 이는 실시간 MPC 스타일의 계획에 너무 느리게 만든다.
유니시민의 역할은 실시간 계획자보다는 데이터 증강 및 정책 평가 도구로 이루어져 있습니다. 인공 훈련 에피소드를 생성하거나 새로운 상황에서 정책이 무엇을 할 것인지 시각화하거나 배치 전에 안전을 평가할 수 있습니다. 계획 척추로서 Dreamer 또는 TD-MPC2를 대체하는 것은 아닙니다.
진영 / 진영 2 -- 브루스 등, 2024
제니 (Generative Interactive Environments) 는 인터넷 규모의 비디오에 훈련된 구글 딥마인드의 기초 세계 모델이다. 제니 2는 단일 이미지 프롬프트에서 일관된 제어 가능한 세계 시뮬레이션을 생성하여 3D 환경에 확장합니다. 작업 특정 세계 모델과 달리, 제니는 특정 도메인에 정렬 할 수있는 일반 목적 환경 생성자로 설계되었습니다.
로봇에 있어서, 기니의 중요성은 사전 훈련된 기초 모델로서입니다. 로봇 데이터 (이 상호작용의 10-100시간 이상) 에 의해 처음부터 세계 모델을 훈련하는 대신, 당신은 소량의 영역에 대한 데이터에 대해 기니를 미세하게 조정하고 물리학과 공간 관계에 대한 사전 지식을 활용할 수 있습니다. 이 패러다임은 - 기초 세계 모델 + 도메인 정렬 - 기초 언어 모델의 성공을 반영하고 2026~2027년에 이 분야가 나아갈 방향이 될 가능성이 높습니다.
래텐트 우주와 픽셀 우주 세계 모델
이것은 세계 모델을 만들거나 선택할 때 가장 중요한 건축적 결정입니다.
| Property | Latent-Space (Dreamer, TD-MPC2) | Pixel-Space (UniSim, Genie) |
|---|---|---|
| Rollout speed | ~0.1ms per step (GPU) | ~50-200ms per step |
| Planning compatibility | Real-time MPC feasible | Offline planning only |
| Human interpretability | Low (latent vectors are opaque) | High (viewable video frames) |
| Spatial precision | Task-dependent (can be high) | Limited by generation resolution |
| Training compute | Single GPU (hours-days) | Multi-GPU cluster (days-weeks) |
| Data efficiency | Good (100K-1M frames) | Poor (needs millions of frames or pre-training) |
| 일반화 | Narrow (domain-specific) | Broad (foundation models generalize across domains) |
| Best use case | Real-time control + online RL | Data augmentation + offline evaluation |
** 실용적인 권고:** 2026년 대부분의 로봇 프로젝트에서, 잠복 공간 세계 모델을 (Dreamer v3 또는 TD-MPC2) 주요 동화 모델로 사용하십시오. 안전 검토 또는 이해관계자 커뮤니케이션을 위해 인간 검사 가능한 배포가 필요한 경우 잠복 궤도를 요구에 따라 비디오로 변환하는 픽셀 공간 디코더를 추가하십시오. 이것은 여러분이 필요로 할 때 픽셀 공간 시각화의 해석성을 가진 잠자리 공간 계획의 속도를 제공합니다.
교육 데이터 요구 사항
세계 모델은 훈련된 데이터만큼만 좋은데, 이는 세계 모델 성능에서 가장 중요한 요소이며, 현장에 새로 온 팀들이 가장 많이 과소평가하는 요소입니다.
어떤 종류의 자료
세계 모델은 전환 튜플을 필요로 한다: (관측_t, 행동_t, 보상_t, 관측_{t+1}, 수행_t). 로봇에 있어서 관측은 일반적으로 다음과 같은 것을 포함한다.
- ** 하나 또는 여러 카메라에서** (목목에 설치된, 상부 또는 둘 다) RGB 이미지는. 64x64에서 256x256까지의 해상도는 표준입니다. 더 높은 해상도는 대부분의 작업에 대한 비례적인 혜택을 받지 않고 훈련 비용을 증가시킵니다.
- ** 자체 수용 상태:** 관절 위치, 속도, 지탱 상태, 최종 효과자 자세. 항상 이것을 포함합니다.
- ** 액션:** 각 시간 단계에 로봇에게 전송되는 명령어. 무기에서는 일반적으로 합동 속도 또는 최종 효과 델타 명령어입니다. 액션 표현은 배치 정책이 내놓는 것과 일치해야합니다.
- 상상 (오프라인 훈련에서 선택): 과제 완공 신호, 목표까지의 거리와 희소성 있는 성공 지표. 역학 모델을 미리 훈련시키는 데 필요하지는 않지만, 상상력에서의 정책 최적화에 필수적이다.
얼마나 많은 데이터
데이터 요구 사항은 구조와 작업 복잡성에 따라 다릅니다.
- Dreamer v3: 50-200 에피소드 (10K-50K 전환) 단일 작업 조작. 500-2000 에피소드 다중 작업 또는 복잡한 접촉 풍부한 작업.
- TD-MPC2: 조작을 위한 Dreamer와 비슷하다. 간단한 작업에 도달하기 위해 20~50개의 에피소드로 효과적으로 계획하기 시작할 수 있지만 복잡한 작업에는 200+가 필요합니다.
- IRIS: VQ-VAE 토케니저 훈련으로 인해 더 많은 데이터에 굶주린.
- UniSim/Genie: 인터넷 규모의 데이터에 대한 사전 훈련이 필요합니다. 기본 모델이 강하다면 도메인 특정 데이터에 대한 정렬은 50-500 에피소드로 작동 할 수 있습니다.
양식 보다 더 중요 한 질
품질 낮은 데이터는 세계 모델 교육에 적극적으로 해를 끼칩니다.
- 무관한 제어 주파수: 데이터 수집이 변수 속도에 실행될 경우 (때로는 10Hz,때로는 30Hz) 동역학 모델은 무관한 시간 관계를 학습한다. 항상 고정된 주파수에서 기록하고 필요하다면 아래 샘플을 가져오십시오.
- ** 상태 행동 오차:** 관찰 시간표와 행동 시간표가 적절히 동기화되지 않으면 모델은 잘못된 역학을 학습합니다. 소프트웨어 시간표가 아닌 하드웨어 시간표를 사용하십시오.
- 정상 보급이 충분하지 않습니다: 모든 원작 구성에서 시작되는 1000 에피소드의 데이터 세트는 다양한 원상 상태의 200 에피소드보다 적은 가치가 있습니다. 세계 모델은 관찰한 역학을 예측할 수 있습니다.
- ** 부패한 에피소드:** 하드웨어 문제로 인해 작업이 실패한 에피소드 (코더 드리프, 통신 드롭, 지갑 장애) 는 세계 모델에 잘못된 역학을 가르칩니다.
현재 제한
세계적 모델 들 은 강력 하지만, 해결 된 문제 는 아닙니다. 현실적 인 기대 를 설정 하기 위해서는 그 의 한계 에 대해 솔직 하게 말 하는 것 은 필수적 이다.
합중적 인 실수
모든 세계 모델 예측에는 약간의 오류가 있습니다. 100+ 단계에 대한 모델을 실행하면 이러한 오류가 합쳐집니다. 각 예측은 지형 진실이 아닌 이전 예측에 기초합니다. 단계 200에 이르면 상상된 궤도는 실제로 일어날 것과 거의 유사하지 않을 수 있습니다. 이것은 현재의 모델에 대한 효과적인 계획 지평선을 약 20-50 단계로 제한합니다. 10Hz 제어에서 2-5 초. 더 긴 계획 지평을 필요로 하는 작업들은 계층적 접근이나 실제 관찰에 주기적으로 재결합이 필요합니다.
분배 전환
세계 모델은 훈련 중에 본 상태의 공간의 영역에서만 정확합니다. 만약 당신의 정책이 세계 모델이 전혀 경험하지 못한 상태를 탐구한다면 -- 새로운 객체 구성, 비정상적인 충돌 상태, 또는 다른 조명 상태 -- 모델의 예측은 신뢰할 수 없게됩니다. 더 나쁜 것은, 정책은 세계 모델의 부정확성을 이용하는 법을 배울 수 있으며, 현실에 전달되지 않는 "이상의" 높은 보상 궤도를 찾을 수 있습니다. 집합 기반 불확실성 추정 (다중 세계 모델을 훈련하고 예측 불일치를 측정하는) 은 불확실한 예측을 표시함으로써 부분적으로 이를 완화합니다.
장기간 충실 함
분포 속에서도, 세계 모델들은 접촉이 풍부한 긴 연계 상호작용에 어려움을 겪습니다. 세 블록을 쌓아, 여러 가이드를 통해 케이블을 배열하거나 다중 부분 메커니즘을 조립하는 것은 각각 수백 개의 접촉 이벤트를 순서대로 정확하게 예측하는 것이 필요합니다. 현재 세계 모델들은 짧은 접촉 순서 (잡고, 밀어 넣고) 를 처리할 수 있지만, 확장된 다단계 조립 작업에 저하할 수 있습니다. 이것은 활발한 연구 경계가 있습니다.
온라인 계획 비용 계산
세계 모델의 MPC 스타일 계획에는 모든 제어 단계에 수백 개의 후보 궤도를 롤링해야 합니다. MPPI의 TD-MPC2에 대해 이것은 512 개의 롤러웃 x 5 단계 = 2560 동적 모델이 제어 단계 당 앞으로 통과합니다. RTX 4090에서는 ~ 15Hz에서 실행되며, 이는 많은 조작 작업에 적합하지만 고 주파수 이동 제어에 충분하지 않습니다. 아모티스 된 계획 (기획자를 반응 정책으로 유통) 은 100Hz+를 달성 할 수 있지만 추가적인 훈련이 필요합니다.
세계 모델들이 VLA와 전파 정책들을 어떻게 보완하는가
세계 모델은 비전 언어 행동 (VLA) 모델이나 전파 정책의 대상이 아닙니다. 그들은 로봇 학습 스택의 다른 층을 차지하고 이러한 정책 아키텍처와 결합하면 가장 강력합니다.
세계 모델 + VLA: RT-2 또는 Octo와 같은 VLA는 시각적 관찰과 언어 지침에서 행동을 생성합니다. 세계 모델은 검증자로 작용할 수 있습니다. 로봇이 VLA의 제안된 행동을 실행하기 전에, 세계 모델은 결과를 시뮬레이션하고 안전 위반에 대한 검사를 수행합니다. 예측된 결과는 위험 (충돌, 과도한 힘) 이면, 시스템은 행동을 거부하고 대안을 요청할 수 있습니다. 이것은 체스 엔진이 세계 모델을 (게임 규칙) 사용하여 후보의 움직임을 평가하기 전에 하나를 선택하는 것과 유사합니다.
세계 모델 + 전파 정책: 전파 정책은 학습된 분포에서 샘플링을 통해 다양한 행동 궤도를 생성합니다. 세계 모델은 예측된 결과 품질에 따라 이러한 후보자를 점수를 얻을 수 있으며, 가장 성공할 가능성이 높은 궤도를 선택합니다. 이것은 전파 정책의 다모달적 표현력을 세계 모델의 미래 지향적인 평가와 결합합니다. 실제적으로는, 이것은 8-16명의 후보 경로를 생성하기 위해 퍼포먼스 정책의 단호화 과정을 실행하고, 각자가 세계 모델을 통해 실행하고, 가장 높은 예측된 보상을 가진 것을 실행하는 것을 의미합니다.
** 데이터 증강을 위한 세계 모델:** 아마도 가장 실용적인 단기 사용은: 수집된 데이터에 대한 세계 모델을 훈련시키고, 나중에 VLA 또는 디스포지션 정책에 대한 합성 훈련 에피소드를 생성하는 데 사용한다. 이것은 추가 데이터 수집보다는 GPU 계산의 비용으로 효과적인 데이터 세트의 크기를 3-10배로 증가시킬 수 있습니다. 합성 데이터는 실제 데이터 (일반적으로 50-80% 합성, 20-50% 실제) 와 혼합되어 지형성을 유지해야 합니다.
실용적인 비교: Dreamer v3 vs IRIS vs TD-MPC2 vs UniSim
| Property | Dreamer v3 | IRIS | TD-MPC2 | UniSim |
|---|---|---|---|---|
| Architecture | RSSM (GRU + stochastic latent) | VQ-VAE + autoregressive Transformer | MLP encoder + MLP dynamics | Video diffusion (U-Net or DiT) |
| Parameters | ~20M (S), ~100M (L), ~200M (XL) | ~80M (base), ~300M (large) | ~5M (S), ~19M (M), ~317M (L) | ~1-3B |
| Data needs (single task) | 50-200 episodes | 200-500 episodes | 50-200 episodes | Pre-trained + 50-500 fine-tune episodes |
| Training GPU | 1x RTX 3090 (6-24h) | 1x RTX 3090 (12-48h) | 1x RTX 3090 (2-12h) | 8x A100 (days-weeks) |
| Inference speed | ~50us/step (imagination) | ~1ms/token | ~0.1ms/step (latent rollout) | ~100-200ms/frame |
| Primary task domains | 조작, locomotion, games | Atari, discrete-action domains | Continuous control (manipulation, locomotion) | Navigation, manipulation (visual) |
| Key strength | Universal hyperparameters, robust | Scaling properties, discrete tokens | Fast training, flexible reward | Photorealistic, broad generalization |
| Open-source | Yes (danijar/dreamerv3) | Yes (eloialonso/iris) | Yes (nicklashansen/tdmpc2) | No (research preview only) |
RCSV에 대한 연결: 세계 모델 교육의 데이터 수집
좋은 세계 모델을 구축하는 것은 좋은 데이터로 시작됩니다. RCSV의 [데이터 수집 서비스] (
세계 모델을 훈련하는 팀들을 위해 우리는 Dreamer v3 (NPZ 에피소드), TD-MPC2 (HDF5) 및 HuggingFace LeRobot 생태계 (파켓 + 비디오) 와 호환되는 형식으로 데이터 세트를 제공합니다. 각 데이터 세트에는 proprioceptive 상태 (관직 위치, 속도, 지잡기 상태), 멀티뷰 RGB (목목 + 640x480의 상부 카메라) 및 캘리브레이션 액션 레이블이 포함되어 있습니다.
세계 모델 사전 훈련은 특히 데이터 다양성에서 혜택을 누립니다. 다양한 시나리오, 객체 및 조작 전략을 아우르는 에피소드입니다. 우리의 [공공적인 데이터 세트] (T1
관련 독서
- Dreamer vs IRIS vs TD-MPC2 -- 세계 모델 선택에 대한 상세한 비교
- [세계 모델에 시작] (T4
) - [로봇 학습에 대한 전파 정책] (
T5 ) - 전파 정책이 세계 모델을 어떻게 보완하는지 - VLA 모델 설명 -- 비전 언어 행동 모델과 세계 모델 통합
- [robot training data는 무엇인가?]
- RCSV 데이터 서비스 -- 세계 모델 교육의 궤도 데이터 집합
- 공공적인 데이터 세트 -- 사용 가능한 조작 데이터 세트







