드림어 vs IRIS vs TD-MPC2: 로봇을 위한 세계 모델을 선택
드림어 v3, IRIS, TD-MPC2는 직접적인 비교를 했습니다. 건축 차이, 훈련 비용, 추론 속도, ROS2와 LeRobot의 통합, 그리고 로봇 프로젝트의 올바른 세계 모델을 선택하는 의사 결정 프레임워크.
제리 허랑 · 2026년 4월 22일
2026년 세계 모델 아키텍처 세 가지로 로봇 연구 분야가 지배적이다. 드림어 v3, IRIS, TD-MPC2. 각각은 학습 환경 역학에 근본적으로 다른 접근 방식을 취하고 있으며 올바른 선택은 작업, 하드웨어, 데이터 및 배포 요구 사항에 달려 있습니다. 이 문서에서는 해당 결정을 내릴 수 있도록 전문가 중심의 비교를 제공합니다.
세계적 모델 패러다임: 빠른 재조명
세계 모델은 다음으로 무슨 일이 일어날지 예측하는 법을 배우는데: 현재 상태와 행동을 고려하면 미래 상태와 보상을 예측합니다. 훈련되면 모델은 학습된 시뮬레이터 역할을 합니다. 에이전트는 실제 로봇을 만지지 않고 정책, 계획을 세우고, 안전성을 평가하기 위해 세계 모델 내부에 수천 개의 궤도를 "상상태" 할 수 있습니다. 자세한 소개를 위해, 우리의 동반 기사를 참조하십시오: [로봇의 세계 모델: 왜 중요하고 어떻게 작동하는지]
여기서 비교된 세 가지 모델은 세 가지 다른 디자인 철학을 나타냅니다.
- ** 꿈꾸는 v3:** 스토카스틱 잠잠 변수와 반복되는 상태 공간 모델. 상상 속에서 배우-비평적 정책을 학습합니다.
- IRIS: 자율적 트랜스포머에 의해 모델링된 토큰화된 관찰과 동작. 다음 토큰 예측을 통해 학습한다.
- TD-MPC2: 간단한 MLP 기반의 잠잠한 동적 모델. 행동 선택에 온라인 모델 예측 제어 (MPPI) 를 사용합니다.
건축물 깊이 다이빙
꿈꾸는 v3: 반복적인 상태 공간 모델
Dreamer v3는 각각의 시간 단계에서 두 종류의 상태를 유지하는 반복 상태 공간 모델을 사용합니다: GRU에 의해 계산된 결정적 반복 상태 h_t, 그리고 범주 배포에서 샘플링 된 스토카스틱 잠수 상태 z_t. 결정적 상태는 장기적인 의존성을 포착합니다 (지금까지 에피소드에서 일어난 일), Stochastic 상태는 현재 상황에 대한 불확실성을 포착합니다 (모델이 확실하지 않은 것).
전체 모델은 5개의 구성 요소로 구성되어 있습니다.
- 열 모델: h_t = f(h_{t-1}, z_{t-1}, a_{t-1}) -- 역사를 통합하는 GRU
- **
- *역학 예측자: * z_t * p * z_t * h_t * = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = = =
- ** 디코더:** o_t ~ p\o_t
, z_t) -- 훈련 신호를 위한 관찰을 재조성합니다 - ** 보상/연속 예측: ** r_t ~ p\r_t , h_t, z_t), c_t ~ p\ c_t , h_t, z_t) - 보상과 에피소드 연속을 예측합니다
상상력 중에, 코더는 사용되지 않습니다 (실적 관측이 없습니다). 동학 예측자는 전사에서 z_t 샘플을 가져가며, 순서 모델은 h_t를 진행하고, 배우가 행동을 선택합니다. 비평가자는 람바-회복 추정기를 사용하여 배우 업데이트의 장점을 계산하기 위해 상상된 궤도를 평가합니다.
v3의 주요 설계 선택: 스토카스틱 상태는 32 개의 카테고리 변수를 사용하며, 각각 32 개의 클래스를 가지고 있으며, 가능한 32^32의 분리된 잠자리 공간을 제공합니다. 이 분리된 표현은 이전 버전의 가우시안 잠자리 변수를 괴롭힌 후속 붕괴 문제를 피하고, 더 날카롭고 정보화 된 표현을 제공합니다.
IRIS: 토큰화된 오토레그레시브 세계 모델
IRIS는 세계 모델을 순서 모델링 문제로 재사상한다. 먼저 VQ-VAE (벡터 양자 변동자동화 암호) 를 훈련시켜 각 관찰 프레임을 고정된 수의 단독 토큰으로 압축한다 (일반적으로 512-1024의 코드북 크기의 프레임에 16-64 토큰). 세계 모델은 다음 시점의 시점과 시점의 시점들을 고려하여 다음 시점의 시점을 예측하는 자동 퇴행성 트랜스포머입니다.
단일 전환의 순서 구조는 다음과 같습니다.
트랜스포머는 이 평평한 순서 과정을 원시적 주의를 기울여서 전작의 모든 토큰의 각 토큰을 예측합니다. 이것은 GPT 스타일의 언어 모델링과 건축적으로 동일합니다. "언어"는 단어 토큰 대신 관찰 및 행동 토큰입니다.
IRIS의 장점은 NLP에서 막대한 규모로 검증된 트랜스포머 확장 속성을 직접 활용한다는 것입니다. VQ-VAE 토큰화가 손실이 있다는 단점이 있습니다. 코드북의 해상도 이하의 공간적 세부 사항은 폐기됩니다. 몇 피클로 차이가있는 객체 위치를 구별해야하는 작업에서는 이것은 병목이 될 수 있습니다. 토케니저 품질은 세계 모델 정확성에 한계를 설정합니다.
TD-MPC2: 온라인 계획과 함께 있는 잠정 동적
TD-MPC2는 세 가지 중 가장 간단한 건축적 접근 방식을 취하고 있습니다. MLP 기반의 네 가지 구성 요소를 학습합니다.
- 코더: h(o_t) -> z_t -- 잠복 상태의 관찰을 지도로 표시합니다
- 역학 모델: d(z_t, a_t) -> z_{t+1} -- 다음 잠잠 상태를 예측합니다
- 상품 예측자: R(z_t, a_t) -> r_t - 즉각적인 보상을 예측합니다
- 값 함수: Q(z_t, a_t) -> v -- 장기적 가치 추정 (TD 학습)
반복도 없고, 관심도 없고, 스톡스틱한 잠잠한 변수도 없습니다. 표준 feed-forward 네트워크만 있습니다. 모델 전체가 잠잠한 역학의 일관성을 결합한 합동 손실로 끝에서 끝으로 훈련됩니다. (예측된 다음 잠잠자는 다음 관찰과 일치해야 합니다), 보상 예측, 시간 차이 (TD) 값 학습.
추론 시 TD-MPC2는 학습된 정책을 사용하지 않고, 대신 모든 제어 단계에 모델 예측 경로 통합 (MPPI) 계획을 수행합니다.
- 샘플 N 후보 행동 순서 (정상적으로 N=512, 지평 = 5 단계)
- 매 순서들을 동적 모델로 로그 आउट하여 예측된 잠정 궤도를 얻을 수 있습니다
- 각 궤도를 점수: 예측된 보상 + Q 함수에서 최종 값의 합
- 계수 순서 중계 평균을 계산하고, 기하급수 점수를 기준으로 중계한다.
- 중계 평균 순서에서 첫 번째 동작을 수행
이 계획-이-공인 접근법은 "정책"이 암시되는 것을 의미합니다. 그것은 세계 모델과 계획 알고리즘의 조합에서 나온 것입니다. 주요 장점은 유연성입니다. 비용은 제어 단계당 ~10-50ms의 계획이며, GPU와 계획 지평에 따라 제어 주파수를 ~20-100Hz로 제한합니다.
머리 대 머리 비교
| Dimension | Dreamer v3 | IRIS | TD-MPC2 |
|---|---|---|---|
| Representation | Discrete categorical latent (32x32) | VQ-VAE discrete tokens | Continuous latent vector |
| Temporal model | GRU recurrence | Causal Transformer attention | Single-step MLP (no history) |
| Action space | Continuous or discrete | Discrete (continuous requires binning) | Continuous (native) |
| Policy learning | Actor-critic in imagination | Actor-critic in imagination | Online MPPI planning (no explicit policy) |
| Training cost (200 episodes) | 6-24h on 1x RTX 3090 | 12-48h on 1x RTX 3090 | 2-12h on 1x RTX 3090 |
| Inference latency | ~1ms (policy forward pass) | ~5ms (autoregressive decoding) | ~10-50ms (MPPI planning loop) |
| Max control freq | ~100-500Hz | ~50-200Hz | ~20-100Hz |
| Imagination horizon | 15-50 steps (configurable) | Limited by context window | 3-10 steps (MPPI horizon) |
| Reward flexibility | Fixed at training time | Fixed at training time | Changeable at deployment time |
| Open-source repo | danijar/dreamerv3 (JAX) | eloialonso/iris (PyTorch) | nicklashansen/tdmpc2 (PyTorch) |
| License | MIT | MIT | MIT |
언제 각 것 을 사용 해야 합니까?
드림어 v3를 선택하세요
- ** 긴 계획 지평을 가진 지속적인 제어가 필요합니다.** 꿈꾸는 사람의 RSSM는 금지적인 계산 비용 없이 15~50 단계를 앞서 줄 수 있으며, 배우-비평가들은 이러한 긴 지평을 통해 최적화하는 것을 배우게 됩니다. 이것은 로봇이 포착 접근, 손가락 배치 및 조정된 순서로 승강을 계획해야 하는 현명한 조작과 같은 작업에 가장 좋은 선택이 됩니다.
- ** 증명된, 잘 문서화된 프레임워크가 필요합니다.** Dreamer v3는 150개 이상의 작업에 적용되었으며 대부분의 도메인에서 실행되는 단일 하이퍼파라미터 집합으로 제공됩니다. 코드베이스는 깨끗하고 잘 유지됩니다.
- 당신의 행동 공간은 연속적입니다. 드림어어는 가우시스 배우를 통해 연속적인 행동을 원천적으로 지원합니다.
- ** 당신은 실제 로봇에 온라인 RL를 수행합니다.** 드림어의 샘플 효율성은 모델 없는 방법보다 (100~1000배 더 낫다) 즉 실제 로봇 상호작용에서 몇 주가 아니라 몇 시간 안에 배울 수 있습니다. 상상력을 기반으로 하는 정책 업데이트는 위험 없는 것입니다. 데이터 수집만이 실제 세계와 상호 작용합니다.
- ** JAX에 대해 편안하다.** 참고 구현은 JAX에 있습니다. 이것은 뛰어난 GPU 활용을 제공하지만 PyTorch보다 강렬한 학습 곡선을 가지고 있습니다.
IRIS를 선택하면:
- 당신의 행동은 자연적으로 사별적이거나 사별할 수 있습니다. IRIS는 모든 것을 토큰으로 모델링하므로 행동 공간이 이미 사별 (그리퍼 오픈/클로스, 내비게이션 명령어) 또는 관리 가능한 다수의 범주에 효과적으로 입력될 때 가장 잘 작동합니다.
- ** 트랜스포머 확장 기능을 활용하고자 합니다.** 큰 컴퓨팅에 접근할 수 있고 다양한 작업을 처리할 수 있는 세계 모델을 확장할 수 있다고 생각한다면 IRIS의 아키텍처는 확장에 가장 자연스러운 방법이다. 동일한 아키텍처는 기존의 트랜스포머 확장 레시피를 사용하여 80M에서 수십억 매개 변수에까지 성장할 수 있습니다.
- 당신은 생성적인 세계 모델에 관심이 있습니다. IRIS는 자율적으로 관찰 토큰을 생성하기 때문에 동일한 행동 순서에 대한 다양한 가능한 미래 샘플을 얻을 수 있습니다. 이것은 불확실성 추정 및 하류 정책에 대한 교육 데이터를 생성하는 데 유용합니다.
- 당신의 작업 영역이 검증되었습니다. IRIS는 주로 아타리 및 간단한 제어 작업에 검증되었습니다. 로봇 응용 프로그램이 연속적이고 고차원적인 동작 공간을 포함하면 (7-DOF 팔 + 지갑) 당신은 신중하게 프로토타입을 만들어서 동작 диск리테이션이 병목 성능을 방해하지 않는지 확인해야합니다.
TD-MPC2를 선택하세요
- ** 배포 시 유연한 보상 기능이 필요합니다.** TD-MPC2는 세계 모델과 학습된 값 기능을 사용하여 온라인 계획을 수립하기 때문에, 테스트 시간에 재교육 없이 보상 기능을 수정할 수 있습니다. 새로운 목표 위치를 지정하거나 충돌 벌금을 추가하거나 작업 목표를 완전히 변경합니다. 계획자는 적응합니다. 이것은 실행 시간에 목표가 지정된 응용 프로그램에 있어서 매우 유용합니다.
- ** 가장 빠른 훈련이 필요합니다.** TD-MPC2의 MLP 기반 아키텍처는 Dreamer보다 2-5배나 IRIS보다 5-10배나 더 빠르게 훈련합니다. 빠른 프로토타입 및 반복에 있어 이것은 상당한 장점입니다.
- 여러 작업에 대한 단일 모델이 필요합니다. TD-MPC2는 104 작업을 해결하는 단일 모델을 보여줬습니다. "317M 매개 변수" 변종. 만약 당신이 같은 로봇과 많은 작업 변형을 배치한다면, 하나의 큰 TD-MPC2 모델은 각각의 작업에 대한 별도의 Dreamer 모델을 훈련하는 것보다 더 실용적일 수 있습니다.
- 당신의 제어 주파수 요구 사항은 10-50Hz입니다. MPPI 계획 루프는 학습된 정책 전진과 비교하여 지연을 추가하지만 대부분의 조작 작업 (10-30Hz 제어) 에서 10-50ms 계획 시간은 허용됩니다.
- ** 당신은 PyTorch을 선호합니다.** 참고 구현은 최소한의 의존성을 가진 깨끗한 PyTorch입니다.
기존 스택과 통합
ROS2 통합
3개의 프레임워크 중 어느 것도 ROS2 통합을 가지고 있지 않지만 ROS2 노드에 포장하는 것은 간단합니다. 세 가지의 패턴은 동일합니다.
rclpy import rclpy.node import Node sensor_msgs.msg import JointState, Image from std_msgs.msg import Float64MultiArray class WorldModelNode(Node): def __init___(self, world_model, planner): super(___init_('world_model_node') self.model = world_model self.planner = planner #Observations self.create_subscriptionImage, '/camera/image_image', self.image_cb, 10) self.create_subscriptionJointState, '/action_joint_states', self.joint_cb, self.cb, self.c.d) self.control (self.control) self.control (self.control) * (self.publish/self.publish, self.commode.com, self.commode.com, self.commode.com, self.commode.com, self.
TD-MPC2에서는 MPPI 알고리즘을 계획하는 역할을 한다. Dreamer에서는 학습된 배우 네트워크이다. IRIS에서는 학습된 배우 또는 토큰화된 액션 공간에 대한 검색이다. ROS2 통합의 핵심 차이점은 지연성이다. Dreamer의 배우 앞을 통과하는 것은 ~1ms에 완료되며 TD-MPC2의 MPPI 루프는 10-50ms에 필요한데, 이는 제어 타이머를 구성하는 방법에 영향을 미친다.
레로봇 통합
HuggingFace의 [LeRobot 프레임워크] (
lerobot.common.datasets.lerobot_dataset import LeRobotDataset import numpy np # LeRobot dataset numpy 로드 # LeRobot dataset = LeRobotDataset("lerobot/pusht") # Dreamer- 호환 NPZ 에피소드 에피소드_idx에 대한 데이터셋.episode_data_stack[""에서": 에피소드 = 데이터셋.hf_dataset.filter(lambda x: x["episode_index"] =="episode_idx) ==\savez_compressedf"episodes/episode_{episode_idx}.nodepz", image=nodep.stack ](((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((
TD-MPC2를 대신 HDF5 형식으로 변환하여 IRIS를 위해, 트랜스포머 세계 모델을 훈련하기 전에 추가적으로 VQ-VAE 토케니저를 관찰 이미지에 훈련해야합니다.
체육관 / 무조코 통합
이 세 프레임워크 모두 Gimnasium (전에는 OpenAI Gym) 환경을 네이티브 또는 최소한의 구성으로 지원합니다. 이것은 실제 하드웨어로 이전하기 전에 시뮬레이션에서 프로토타입을 쉽게 만듭니다.
- ** 드림어 v3:** DM 컨트롤, 아타리, 마인크래프트, 그리고 커스터마이즈 헬스클럽 엔비디아를 위한 내장 지원
- IRIS: 아타리 내장 지원. 체육관 연속 제어에는 동작 분별을 위해 사용자 지정 포장지가 필요합니다.
- TD-MPC2: DMControl, Meta-World, Maniskill, MyoSuite에 대한 내장 지원. 새로운 Gymnasium envs를 추가하려면 작업 구성 파일을 구현해야 합니다 (10-20 라인).
모델별 데이터 요구 사항
궤도 유형
세 가지 모델 모두 궤도 데이터에서 학습하지만 다른 특성에 민감합니다.
- Dreamer v3는 명확한 시간 구조를 가진 궤도를 필요로 한다. 보상 예측자가 기량화하기 위해 부정적인 예제를 필요로 하기 때문에 성공적이나 실패한 시도를 포함하는 에피소드로부터 이익을 얻는다. 무작위 탐구 데이터는 초기 세계 모델 사전 훈련에 유용하다. 작업별 시범은 정책을 개선한다.
- IRIS는 좋은 VQ-VAE 코드북을 훈련시키기 위해 다양한 궤도를 필요로 합니다. 모든 에피소드가 시각적으로 비슷하다면, 코드북은 새로운 상황들을 잘 다루지 못할 것입니다. 시각적 다양성을 우선시하십시오.
- TD-MPC2는 학습된 정책보다는 온라인 계획만을 이용하기 때문에 데이터 품질에 있어서 가장 유연하다. 다소 부정확한 세계 모델에도 불구하고, MPPI 계획은 종종 많은 후보자를 평가함으로써 좋은 행동을 찾을 수 있다. 그러나 가치 기능 (Q-네트워크) 은 유용한 최종 가치 추정치를 제공하기 위해 충분한 데이터 커버리가 필요합니다.
관찰 모달리
| Modality | Dreamer v3 | IRIS | TD-MPC2 |
|---|---|---|---|
| RGB images | Native (CNN encoder) | Native (VQ-VAE) | Supported (CNN encoder) |
| Proprioception only | Supported (MLP encoder) | Requires state tokenization | Native (default modality) |
| Multi-camera | Concatenate or multi-encoder | Separate VQ-VAE per view | Concatenate encodings |
| Point clouds | Custom encoder needed | Not well-supported | Custom encoder needed |
| Force/torque | Concatenate with proprioception | Tokenize as additional modality | Concatenate with proprioception |
에피소드 길이는
세 모델은 에피소드 길이를 다르게 처리합니다.
- Dreamer v3: 고정 길이의 서브섹벤스 (일반적으로 50~64 단계) 를 통해 어떤 길이의 에피소드에서 샘플을 수집합니다. 긴 에피소드 (1000+ 단계) 는 괜찮습니다. RSSM의 반복 상태는 맥락을 유지합니다. 이것은 Dreamer를 긴 조작 작업에 잘 적합합니다.
- IRIS: 트랜스포머의 컨텍스트 윈도우에 의해 제한됩니다. 프레임에 1024 토큰의 컨텍스트와 16 토큰 + 1 액션 토큰으로, 당신은 대략 60 프레임의 컨텍스트를 얻을 수 있습니다. 더 긴 에피소드는 줄여서 또는 쪼개는 것을 필요로 합니다. 이는 장거리 의존성을 잃을 수 있습니다.
- TD-MPC2: 단기 하위 계열 (일반적으로 5-10 단계) 에 열차가 이루어집니다. 동학 모델은 단 단계이며 Q 함수는 TD 학습을 통해 장기적인 신용 할당을 처리합니다. 에피소드 길이는 훈련에 영향을 미치지 않지만 MPPI 계획 지평은 일반적으로 3-10 단계에 불과하므로 계획자는 긴 지평을 위한 작업에 Q 함수에 크게 의존합니다.
코드 스타트
꿈꾸는 사람 v3
# 설치 (JAX + GPU) pip 설치 jax[cuda12] jaxlib dreamerv3 # DMControl Reacher python dreamerv3/main.py \ --configs dmc_vision \ --task dmc_reacher_easy \ --logdir ./logdir/reacher \ --steps 500000 # 트레이닝 사용자 지정 로봇 데이터 (NPZ 형식) python dreamerv3/main.py \ --configs dmc_vision \ --task_robot \ --logdir ./logdir/custom \ --data_dir /path/to/npz\episodes/ \ --steps 1000000
IRIS
# git clone를 설치
TD-MPC2
# 펌프 설치 tdmpc2 # DMControl Walker python train.py 작업=견 실행 모델_size=48 단계=10000000 # 80 DMControl 작업에서 단일 모델을 열고 python train.py 작업=mt80 모델_size=317 단계=25000000 배트_size=1024 # MPPI 계획으로 평가를 해 Python evaluate.py 작업=견 실행 체크포인트=/path/to/model.pt \ num_samples=512 지평 =5
일반적인 실패 모드와 디버깅 방법
세계 모델 은 미묘 한 예측 / 평균 미래
증상: 해독된 상상적 관찰은 여러 가지 유연한 결과의 평균과 비슷합니다. 객체는 유령적이거나 복제된 것처럼 보입니다.
** 진단:** 모델의 잠잠 공간은 멀티모다리티를 포착하지 않습니다. 가우스 잠잠 변수 (Dreamer v1/v2) 또는 크기가 적어있는 VQ-VAE 코드북 (IRIS) 와 공통적입니다.
** 수정:** Dreamer에서 가우스식 아닌 v3의 개별적인 카테고리 라텐트를 사용하는지 확인하세요. IRIS에서 VQ-VAE 코드북 크기를 (1024 또는 2048) 및 프레임에 대한 토큰을 (32 또는 64) 증가시켜 보세요. TD-MPC2에서는 이 문제가 덜 발생하기 때문에, 잠자리 공간은 작업 조건이므로 관측 재구성할 필요가 없습니다.
정책 은 세계 모델 의 부정확 을 이용 한다
** 증상:** 정책은 상상할 수 있는 높은 보상을 달성하지만 실제 로봇에 실패합니다. 세계 모델에서 "실점"을 발견했습니다. 예측된 높은 보상을 얻는 상태 행동 순서이지만 실제 물리학에 해당하지 않습니다.
** 진단:** 정책은 국가 행동 공간의 영역으로 이동했으며 세계 모델이 정확하지 않으며 이러한 부정확함을 이용하고 있습니다.
** 수정:** (1) 3-5개의 세계 모델의 집합을 훈련시키고, 집합 예측이 일치하지 않는 국가를 방문하는 정책에 대한 처벌을 한다. (2) 합성 오류를 줄이기 위해 상상력 지평을 짧게 한다. (3) 정책이 운영되고 있는 지역에서 더 많은 실제 데이터를 수집하고, 세계 모델을 재 훈련한다. TD-MPC2에서는 MPPI 계획 지평이 이미 짧다 (3-10 단계), 이는 덜 흔하다.
VQ-VAE 코드북 붕괴 (IRIS)
** 증상:** 코드북 항목의 작은 부분만 사용된다. 재구성된 관찰은 세부적인 내용이 부족하다.
** 진단:** VQ-VAE 훈련은 코드 하위 집합을 사용하게 되었습니다. 이것은 VQ-VAE의 잘 알려진 문제입니다.
** 수정:** (1) gradient 기반의 대신 기하급수 이동 평균 (EMA) 코드북 업데이트를 사용한다. (2) 코드북 크기를 높인다. (3) 코드북 리셋을 추가한다: 코더 출력 배포에서 주기적으로 사용하지 않은 코드를 재시작한다. (4) 0.25의 약속 손실 무게를 사용한다 (IRIS의 기본).
TD 학습 불안정성 (TD-MPC2)
증상: Q 값은 훈련 중에 경각지거나 흔들립니다. MPPI 계획자는 부조리적인 동작을 만듭니다.
** 진단:** 값 함수에 대한 시간 차이 학습은 불안정하며, 종종 너무 높은 학습 속도 또는 목표 네트워크 업데이트 빈도가 충분하지 않아서 발생합니다.
** 수정:** (1) Q 함수의 학습 속도를 줄이십시오 (1e-3 대신 3e-4을 시도하십시오). (2) 목표 네트워크 소프트 업데이트 계수 tau를 증가시켜 (더 부드러운 업데이트를 위해 0.01에서 0.005까지) (3) Q 네트워크에 계층 정상화를 추가하십시오. TD-MPC2의 기본 하이퍼 파라미터는 일반적으로 안정적입니다. 따라서 수정하는 경우 먼저 기본으로 돌아가십시오.
데이터 다양성이 부족
** 증상:** 세계 모델은 훈련과 같은 상태에 대한 정확한 예측을 하지만 약간 다른 초기 구성에 대해 재앙적으로 실패합니다.
** 진단:** 데이터 세트는 초기 상태, 객체 구성 또는 환경 조건에 대한 충분한 변이가 없습니다.
** 수정:** 이것은 데이터 문제, 모델 문제 아닙니다. 의도적으로 무작위로 초기 조건을 가진 더 많은 에피소드를 수집하십시오. RCSV의 데이터 수집 서비스 는 세계 모델 훈련에 대한 국가 공간 커버리를 극대화하도록 특별히 설계된 구조화된 무작위로 프로토콜을 따르고 있습니다. 엄지손가락 규칙으로, 데이터 세트는 배포 시 예상되는 변동 범위를 3-5배로 커버해야합니다.
관련 독서
- [로봇기술의 세계 모델: 왜 중요한지] (
T3 ) - [세계 모델에 대해 시작] (T4)
- [로봇 학습에 대한 분포 정책] (
T5 ) -- 보조 정책 구조 - LeRobot 프레임워크 Guide -- 세계 모델과 호환되는 데이터셋 형식
- [robot training data는 무엇인가?]
- RCSV 데이터 서비스 -- 세계 모델 교육의 궤도 데이터 집합







