로봇 학습 에 대한 세계적 모델 을 시작 하는 것: 실용적 인 지침서
로봇 세계 모델 훈련에 대한 단계별 가이드. 전제 조건, 데이터 준비, Dreamer v3 훈련, 평가 및 배포를 포함합니다. 코드 예제, 일반적인 오류 및 FAQ를 포함합니다.
제리 허랑 · 2026년 4월 22일
이 책은 로봇 작업에 대한 첫 번째 세계 모델의 훈련에 대한 실무 가이드입니다. 우리는 전체 파이프라인을 통해 진행합니다. 모델을 선택하고 데이터를 준비하고, 훈련을 받으며, 상상력의 품질을 평가하고, 훈련된 모델을 계획 또는 정책 개선에 사용하는 것입니다. 모든 코드 예제들은 Dreamer v3를 주요 예로 사용하며, TD-MPC2 및 IRIS 대안에 대한 메모가 있습니다.
전제 조건
하드웨어
- GPU: NVIDIA RTX 3090, RTX 4090, 또는 A100. Dreamer v3 및 TD-MPC2는 단일 소비자 GPU에 작동합니다. VRAM 요구 사항: 상태 기반 작업에 대한 최소 12GB, 64x64 이미지 기반 작업에 대한 24GB 권장합니다. 256x256 이미지에는 24GB+ VRAM가 필요합니다.
- CPU/RAM: 8+ 코어, 32GB+ RAM. 데이터 로딩은 이미지 관측을 위한 큰 데이터 세트에서 CPU에 묶여 있습니다. NVMe SSD 저장소는 강력히 권장됩니다. HDD 기반 데이터 로딩은 병목 훈련이 될 것입니다.
- ** 로봇 (초기 실험에 대해서는 선택적):** 물리적인 하드웨어가 필요하지 않은 시뮬레이션 환경 (DMControl, Meta-World, Robosuite) 을 시작하면 된다. 실제 로봇 실험에 대비할 때 위치/속도 제어 및 적어도 하나의 카메라를 가진 모든 팔이 작동한다.
소프트웨어
- ** 파이썬 3.10+**
- Dreamer v3에 대한 CUDA 또는 **PyTorch 2.0+**에 대한 (TD-MPC2에 대한 IRIS)
- 시뮬레이션 환경을 위한 Gimnasium (전엔 OpenAI Gym)
- 중량 & 편견 (선택하지만 실험 추적을 위해 권장)
데이터
로봇 또는 시뮬레이션 환경에서 기록된 튜플의 순서 (관측, 행동, 보상, 완료) 를 참조하십시오. 초기 실험을 위해 기존 데이터 세트를 사용하거나 시뮬레이션 환경에서 데이터를 수집하십시오. 실제 로봇 세계 모델에 대해서는 작업 복잡성에 따라 50-500 에피소드가 필요합니다. 자세한 데이터 요구 사항은 [우리의 세계 모델 개요]
첫 번째 단계: 당신 의 세계적 모델 을 선택 하십시오
이 결정 트리를 사용하여 프로젝트의 올바른 출발점을 선택하십시오.
결정나무: 어떤 세계 모델?
Q1: 당신의 행동 공간은 연속적인가?
- 예 -> Q2로 이동
- 아니 (비밀한 동작) -> IRIS (내티브 디스크릿 지원) 또는 Dreamer v3 (비밀한 지원) 를 고려하십시오
Q2: 배포 시 보상/목표 변경이 필요합니까?
- 예 -> 사용 TD-MPC2 (플렉스블 보상으로 온라인 계획)
- 아니 -> Q3로 이동
문제3: 가능한 한 빠른 훈련 반복이 필요하십니까?
- 예 -> TD-MPC2**를 사용하라 (2-12시간의 훈련)
- 아니 -> Q4로 가
문제4: 당신의 임무는 15단계 이상의 계획을 세우는 것이 필요합니까?
- 예 -> Dreamer v3**를 사용하세요 (RSSM로 긴 상상력 지평)
- 드림버 v3 또는 TD-MPC2가 작동합니다. 드림버 v3는 더 안전한 기본입니다.
이 가이드의 나머지 부분에서는 Dreamer v3를 주요 예로 사용 하므로 가장 널리 적용 됩니다.
2단계: 데이터 를 준비 하십시오
에피소드 형식
드림어 v3는 NPZ 파일의 디렉토리로 데이터를 예상합니다. 각 NPZ 파일에는 다음과 같은 키가 있는 NumPy 배열이 있습니다.
numpy import np # 예제: 200 시간 단계 에피소드 = { # 시각 관측: (T, H, W, C), uint8, 0-255 ' 이미지': np.random.randint(0, 255, (200, 64, 64, 3), dtype=np.uint8), # 고유 상태: (T, state_dim), float32 # 예제, 7 공동 위치 + 7 공동 속도가 + 1 괄호 상태 = 15 ' 상태': np.random.randn(200, 15).
관찰 구조
관찰 대표에 대한 주요 결정:
- ** 이미지 해상도:** 64x64로 시작하세요. 이것은 대부분의 테이블탑 조작 작업에 충분하며 128x128보다 4x 더 빨리 열립니다. 모델이 작업에 관련된 시각적 세부 사항을 구별할 수 없다는 것을 관찰하면만 해상도를 증가시킵니다.
- ** 카메라 수:** 한 카메라 (머리 또는 손목 장착) 를 시작하십시오. 다중 카메라 설정은 성능을 향상시키지만 추가 카메라마다 데이터 크기와 훈련 시간을 두 배로 증가시킵니다. 하나의 카메라가 충분하지 않다는 것을 확인한 후에야 카메라를 추가하십시오.
- ** 자체 인식:** 항상 관절 위치, 관절 속도는, 그리고 잡지 상태가 포함됩니다. 이들은 잡음적인 시각 관측을 보완하는 정확한 상태 정보를 제공합니다. 각 차원을 대략 0의 평균 및 단위 변수로 정상화하십시오.
- ** 역사:** Dreamer v3의 RSSM는 반복 상태를 통해 내부적으로 역사를 처리합니다. 프레임을 쌓거나 관찰 역사를 제공 할 필요가 없습니다. 현재 시간 단계의 관찰만합니다.
행동 정상화
이 훈련 실패의 흔한 원인입니다. 세 가지 세계 모델 모두 표준화된 범위에서 행동을 기대합니다.
numpy import numpy np def 정상화_actions(action, action_low, action_high): """action\_high에 대한 행동을 정상화.[-1, 1] 범위."""중점 = (action_high + action_low) / 2.0 반점_range = (action_high - action_low) / 2.0 반점 (action - midpoint) / 반점_range def denormalize_actions(normalised_actions, action_low, action_high): """action\1] 동작을 원래 범위로 변환합니다.""중점 = (action_high + action_low) / 2.0 반점_range = (action_high - action_low) / 2.0 반점 (action_high - action_low) / 2.0 반점 (action_midpoint) / 반점 (action_midpoint) / 반점 (half_range deformalize_actions) ]: "normal화_actions, action_low, action_high_actions, \
Dreamer v3는 내부적으로 동작을 [-1, 1]로 클립합니다. 만약 당신의 원시 동작이 이미 이 범위 안에 있다면 정상화가 필요하지 않습니다. TD-MPC2는 또한 [-1, 1] 정상화 동작을 기대합니다. IRIS는 동작을 캔으로 배제하므로 정상화는 캔링 스키마에 의해 처리됩니다.
레로봇 형식에서 변환
만약 당신의 데이터가 [HuggingFace LeRobot 형식](
lerobot.common.datasets.lerobot_dataset import LeRobotDataset PIL import PIL import PIL import Image import numpy np import os dataset = LeRobotDataset("당신의 사용자 이름/당신의 데이터셋") os.makedirs("dreamer_episodes", exist_ok=True) # 에피소드별로 그룹_indices = 데이터셋.hf_dataset.unique"episode_index") for ep_idx in episode_indices: ep_data = dataset.hf_dataset.filter lambda episode: x"episode\\last_index" (d_d_d_d_d_d_d_d_d_d_d_d_d_d_d_d_d_d_d_d_d_d_d_d_d_d_d_d_d_stack) #extract observations = ep_stack_d_d_d_d_d_d_d_d_d
3단계: 기차
Dreamer v3 설치
# CUDA 지원 파이프 설치와 함께 JAX를 설치합니다 -- jax를 업그레이드합니다 [cuda12]" jaxlib # Clone Dreamer v3 git clone
구성
사용자 지정 로봇 작업에 대한 구성 파일을 생성합니다. Dreamer v3는 YAML 구성을 사용하여 상식 기본 설정으로 우월합니다.
# config/robot_manipulation.yaml # 데이터 데이터_dir: /path/to/dreamer_episodes/ replay_size: 1e6 # 회전 패치에서 버퍼 크기를 재생합니다. 패치_size: 16 # 훈련 패치의 패치 크기를 배치 길이를 50 # 훈련에 대한 후속 길이를 # 세계 모델 rssm: deter: 4096 # 결정적인 상태 크기를 (GRU 숨겨진) 저장: 32 # 카테고리 변수 클래스: 32 # 카테고리 변수 단위당 클래스: 1024 # MLP 숨겨진 분포 단위 앵커더: mlp_keys: 'state' # 관찰 키는 MLP 앵커더를 사용한다 cnn_keys: 'image' # 모든 관찰 키는 cnn_keys: 48 # 수행 단계: 모든 단계: CNN 앵커더를 사용한다.
시작 훈련
# 오프라인 데이터에서 열 Python dreamerv3/main.py \ --config 기본 설정 설정 설정 / 로봇을 조작.yaml \ --logdir ./logdir/robot _v1 \ --steps 1000000 # TensorBoard 텐서보드와 모니터링
TD-MPC2 대안:
# 펌프 설치 tdmpc2 # 데이터에 대한 기차 (HDF5 형식) python train.py \ task=custom \ data_dir=/path/to/hdf5_episodes/ \ model_size=19 \ steps=500000 \ batch_size=256
훈련 도중 주의 해야 할 것
이 측정값을 TensorBoard 또는 W&B에서 모니터링하십시오.
- ** 이미지 재구성 손실 (decoder_image):** 꾸준히 감소해야 합니다.
- KL 분차 (kl_loss): 중소 값 (일반적으로 1~10 nats) 으로 회합해야 한다. 만약 0에 가까울 경우, 모델은 스토카스틱 잠수함 ignoring을 하고 있다. KL의 자유 비트를 증가시키거나 KL의 스케일을 감소시키게 된다. 만약 매우 높으면 (>50), 동학 모델은 후기를 예측하는데 어려움을 겪고 있다. 작업은 더 많은 훈련 단계가 필요할 수 있다.
- 상품 예측 손실 (decoder_reward): 특히 모델이 어떤 상태가 최종/성공한지 알아내야 하는 희소한 보상 과제에 대해 감소해야 합니다.
- 배우 손실과 비평가 손실: 시간이 지남에 따라 감소해야 합니다. 배우 손실이 변동적이라면 상상력 배포는 신뢰할 수 없을 수 있습니다.
- ** 상상적 수익:** 세계 모델에 주역을 도입함으로써 상상된 궤도들의 평균 수익. 정책이 개선됨에 따라 증가해야 한다.
4단계: 평가
상상력 롤러 퀄리티
세계 모델을 평가하는 가장 직접적인 방법은 상상된 배포를 시각화하고 현실과 비교하는 것입니다. 실제 에피소드를 고려하면 첫 번째 관찰을 암호화하고, 기록된 동작을 사용하여 세계 모델을 배포하고 예측된 관찰을 해독합니다.
로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드 로드
양적 측정
| Metric | What It Measures | Good Value | Horizon |
|---|---|---|---|
| Reconstruction MSE | Pixel-level prediction accuracy | < 0.01 (normalized) | 1-step |
| SSIM | Structural visual similarity | > 0.85 at step 10, > 0.7 at step 50 | Multi-step |
| Reward prediction accuracy | Can the model predict task success? | > 90% binary classification | 에피소드-level |
| State prediction error | Latent state divergence from ground truth | Task-dependent | Multi-step |
| Policy success rate (in imagination) | Does the learned policy solve the task in the world model? | > 80% | 에피소드-level |
| Policy success rate (real robot) | Does the policy actually work? | Task-dependent (gap with imagined rate indicates model error) | 에피소드-level |
가장 중요한 평가 는 상상 된 성공률 과 실제 성공률 사이의 격차 이다. 만약 정책 이 상상력 에서 95% 이지만 실제 로봇 에서 40% 이 성공한다면, 세계 모델 은 정책 이 이용 하는 중대한 불확정성 을 가지고 있다. 실패 지역 에 대한 더 많은 데이터를 수집 하고 재 훈련 한다.
5단계: 계획 또는 정책 개선에 사용
선택 A: 학습된 정책을 적용하라 (꿈꾼)
드림어의 배우 네트워크는 반응적인 정책입니다. 현재 잠잠 상태를 고려하면 ~ 1ms 내에 동작을 내포합니다. 이것은 가장 간단한 배포 경로입니다.
# 배포 루프 (편화) 에이전트 = 에이전트.로드('./logdir/robot_v1/checkpoint.pkl') 잠자리 = 완료되지 않은 동안 없습니다: obs = get_robot_observation() # {'image': ..., 'state': ...} # 에코드 관찰 및 배우에서 행동을 취하는 행위 = 에이전트.policy((obs, latent) # 비정상화 및 로봇에게 전송합니다 raw_action = 비정상화_actionaction, action_low, action_high) 전송_to_robot(raw_action) 시간.sleep(1.0 / control_frequency) # 예를 들어, 10Hz
옵션 B: TD-MPC2로 모델 예측 제어
TD-MPC2는 MPPI를 통해 온라인 계획에 직접 세계 모델을 사용합니다. 이것은 더 컴퓨팅 집중적이지만 실행 시간에 목표를 변경할 수 있습니다.
TD-MPC2 배포 루프 (편화) tdmpc2 수입 TDMPC2 에이전트 = TDMPC2.load('./checkpoints/tdmpc2_robot.pt') 수행되지 않은 동안: obs = get_robot_observation() # MPPI 계획: 샘플 512 행동 순서, 세계 모델 행동 = agent.act(obs, eval_mode=True) 전송_to_robot(denormalize_actions(action, action_low, action_high)) 시간.sleep(1.0 / control_frequency)
옵션 C: 데이터 증강으로 세계 모델
훈련된 세계 모델을 사용하여 하류 전파 정책 또는 VLA를 훈련시키는 합성 에피소드를 생성합니다. 이것은 가장 낮은 위험 접근 방식입니다. 세계 모델은 오프라인에서 사용되며 제어 루프에서 사용되지 않습니다.
d_numpy = np dramerv3 import Agent agent = Agent.load.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk.jpk
흔히 하는 실수
1 데이터 가 너무 적다
가장 흔한 실패. 팀들은 2050개의 에피소드를 수집하고, 세계 모델을 훈련시키고, 그것을 정확하지 않다고 발견하고, 세계 모델이 그들의 작업에 적합하지 않다고 결론지립니다. 실제로, 20개의 에피소드는 가장 간단한 작업에 충분합니다. 예산은 100200개의 에피소드입니다. 그 숫자를 수집할 수 없다면, Dreamer보다는 TD-MPC2 (온라인 계획으로 인해 더 데이터 효율적인) 를 사용하세요.
2· 잘못된 관찰 방식
세계 모델은 픽셀에서만 로봇 기네마틱스를 배워야 합니다. 이는 직접적으로 합성 상태를 제공하는 것보다 훨씬 더 많은 데이터를 필요로 합니다. 항상 이미지와 함께 proprioceptive 상태를 포함합니다. 반대로, 작업이 필요한 경우에만 자기 인식을 사용하는 것은 로봇 상태에서 캡처되지 않는 객체 위치 또는 방향에 대한 추론을 필요로 합니다. 이 경우, 이미지가 필요합니다.
3· 부적절한 에피소드 다양성
모든 에피소드가 같은 위치에서 시작되는 데이터 세트는 세계 모델에 상태 공간의 좁은 조각을 가르칩니다. 실험 시간에 객체가 약간 다른 위치에있을 때 모델은 야생 예측을합니다. 데이터 수집 과정에서 의도적으로 초기 조건을 무작위로 설정: 객체 위치, 방향, 로봇 시작 구성 및 환경 조건 (빛, 배경).
4. 부합된 제어 주파수
30Hz에서 기록된 훈련 데이터, 10Hz에서 정책을 배포하는 것 (또는 반대로). 세계 모델은 데이터의 시간 해상도에 동력을 학습합니다. 30Hz에서 훈련하면 모든 동작은 작은 상태 변화를 발생시킵니다. 10Hz에서 배포하면 모든 동작은 3배 더 큰 상태 변화를 발생해야합니다. 하지만 모델은 그런 것을 본 적이 없습니다. 항상 데이터 수집 과정에서 사용되는 동일한 주파수에서 배포합니다. 주파수를 변경해야 한다면, 목표 주파수에서 데이터를 다시 수집하세요.
5· 보상 신호 를 무시 하는 것
희귀한 보상 (사pisode 끝에서 성공/실패) 과제를 위해, 보상 예측자는 배우기 위해 충분한 긍정적 인 사례가 필요합니다. 당신의 에피소드의 10%만이 성공한다면, 모델은 결코 보상을 정확하게 예측하는 것을 배우지 않을 수 있습니다. (a) 더 성공적인 시범을 수집하거나 (b) 중간 보상 형성을 추가하거나 (c) 정책 최적화보다는 역학 (데이터 증강) 을 위해 세계 모델을 사용하는 것입니다.
6· 평가 없이 훈련 하는 시간
세계 모델 훈련 손실은 실제 정책 성능이 정체되거나 악화되는 동안 계속 감소할 수 있습니다. 실제 로봇 (또는 지속된 시뮬레이션 에피소드) 에서 100K 훈련 단계마다 평가하십시오. 성능이 악화되면 훈련을 중단하고 마지막 좋은 점검점을 사용하십시오.
훈련 자료 를 어디서 얻을 수 있습니까?
RCSV 데이터 서비스
RCSV의 [관리된 데이터 수집 서비스]
특히 세계 모델 프로젝트에서, 우리는 국가 공간의 커버리를 극대화하는 "진화 다양성" 수집 프로토콜을 제공합니다. 에피소드는 성공적 또는 실패한 작업 완료, 다양한 접근 전략, 혼란 복구 및 가장자리 사례 시나리오를 모두 포함합니다. 이것은 성공적 데이터 세트보다 더 넓은 커버리를 가진 세계 모델을 생산합니다. 파일럿 캠페인은 200개의 에피소드에서 2500달러로 시작됩니다.
데이터 세트를 열
| Dataset | Episodes | Robots | Observations | 세계 모델 Suitability |
|---|---|---|---|---|
| DROID | 76K | Franka Panda | Multi-view RGB, proprio, language | Excellent -- large, diverse, multi-task |
| Bridge V2 | 60K | WidowX | Single RGB, proprio, language | Good -- diverse tasks, single viewpoint |
| Open X-Embodiment | 1M+ | 22 robot types | Varies by sub-dataset | Good for pre-training foundation world models |
| RoboTurk | 2.1K | Sawyer | RGB, proprio | Fair -- smaller scale, good for initial testing |
| RCSV Public Datasets | Varies | UR5e, Franka, ALOHA | Multi-view RGB, proprio, F/T | Good -- pre-formatted for Dreamer/TD-MPC2 |
일반적 세계 모델의 사전 훈련에 대해서는 오픈 X-Embodiment 또는 DROID를 시작하여 특정 로봇과 작업의 데이터를 미세하게 조정하십시오. 사전 훈련 없이 작업 특수한 세계 모델에 대해서는 DROID 또는 Bridge V2가 귀하의 것과 유사한 조작 작업에 필터링되어 좋은 출발점을 제공합니다. RCSV의 공공식 데이터 세트 는 이미 Dreamer v3 및 TD-MPC2로 직접 사용하도록 포맷되었습니다.
자주 묻는 질문
로봇을 위한 세계 모델을 훈련시키기 위해 얼마나 많은 데이터가 필요할까요?
Dreamer v3 또는 TD-MPC2의 단일 조작 작업에 최소 50-200 에피소드 (10K-50K 전환) 이 필요합니다. 객체 위치 변동과 함께 강력한 배포 성능을 위해, 예산 300-500 에피소드. IRIS는 VQ-VAE 토큰 트레이닝 오버헤드 때문에 2-3배 더 필요합니다. 품질과 다양성은 원자량보다 더 중요합니다. 200 개의 다양한 에피소드는 1000 개의 거의 동일한 에피소드를 능가합니다.
하나의 소비자 GPU에 세계 모델을 훈련시킬 수 있을까요?
예. Dreamer v3와 TD-MPC2 모두 단일 RTX 3090 또는 RTX 4090에서 훈련합니다. 데이터 세트 크기와 모델 구성에 따라 훈련 시간은 2-24 시간입니다. IRIS는 단일 GPU에서 계산 집중력이 더 크다 (12-48 시간). UniSim 규모의 픽셀 공간 세계 모델을 훈련하지 않는 한 A100 또는 멀티 GPU 설정이 필요하지 않습니다.
세계 모델과 MuJoCo나 Isaac Sim 같은 시뮬레이터의 차이점은 무엇일까요?
물리 시뮬레이터는 손으로 만든 운동 방정식을 구현한다 (강직체 역학, 접촉 모델, 마찰 뿔). 세계 모델은 데이터에서 역학을 학습한다. 시뮬레이터는 강직체에 대해 정확하지만 변형 가능한 물체, 케이블, 액체 및 센서 소음과 어려움을 겪는다. 세계 모델은 분석적으로 시뮬레이션하기 어려운 현상을 포함하여 훈련 데이터에 존재하는 역학적 요소를 포착합니다. 타협은 세계 모델은 훈련 배포 내에서만 정확하게 예측할 수 있다는 것입니다.
세계 모델이나 전파 정책을 사용해야 할까요?
세계 모델은 계획 및 데이터 증강을 위한 환경 역학을 학습한다. 전파 정책은 관찰에서 행동을 생성하는 제어 정책이다. 당신은 전파 정책에 대한 합성 훈련 데이터를 생성하기 위해 세계 모델을 사용할 수 있습니다. 또는 전파 정책에 의해 제안된 후보 궤도 중 평가 및 선택하기 위해 세계 모델을 사용할 수 있습니다. 만약 당신이 하나를 선택해야 한다면, 직접적인 시범에서 모방 학습을 위해 [방송 정책]
어떻게 내 세계 모델이 배치될 만큼 정확하는지 알 수 있을까요?
실제 세계 궤도를 평가합니다. 초기 관찰을 암호화하고, 기록된 동작을 사용하여 세계 모델을 롤 आउट하고, 예측된 관찰을 실제 기록된 관찰과 비교합니다. 주요 매트릭은: 재구성 MSE, 시각 품질의 SSIM, 보상 예측 정확성 및 지평선 10/20/50에서 상태 예측 오류입니다. 상상하는 롤러우트가 작업의 전형적인 에피소드 길이에 현실과 눈에 띄게 차이가 있다면 모델은 더 많은 데이터 또는 건축적 변경이 필요합니다.
전 훈련된 세계 모델을 로봇의 데이터에 맞춰 조정할 수 있을까요?
예, 그리고 이것은 점점 더 권장되는 접근 방식입니다. Dreamer v3 및 TD-MPC2에서는 시뮬레이션 데이터 (예를 들어 MuJoCo 또는 아이작 시ム) 에 훈련된 체크포인트에서 초기화하고 실제 로봇 데이터에 정렬 할 수 있습니다. 이것은 일반적으로 동적 모델을 실제 세계 물리학에 적응시키기 위해 50-100 개의 실제 에피소드가 필요합니다. 처음부터 훈련 할 때 200-500 에피소드에 비해. 제니 같은 재단 세계 모델은 정밀하게 설계된 것이 바로 이 선열 전-그후-정화 패러다임입니다.
관련 독서
- [로봇 기술 세계 모델: 왜 중요합니까]
- Dreamer vs IRIS vs TD-MPC2 -- 상세한 건축 비교
- [로봇 학습에 대한 분포 정책] (
T8 ) -- 보조 정책 구조 - LeRobot 프레임워크 Guide -- 데이터셋 형식 및 교육 프레임워크
- [robot training data는 무엇인가?]
- RCSV 데이터 서비스 -- 세계 모델 교육에 대한 사용자 정의 데이터 수집
- 공공 데이터 세트 -- 사전 포맷된 데이터 세트







