ドリーマー対IRIS対TD-MPC2: ロボットのための世界モデルを選択
ドリーマー v3,IRIS,TD-MPC2は,対面的に比較した.アーキテクチャの違い,トレーニングコスト,推論速度,ROS2とレロボットとの統合,ロボットプロジェクトのための適切な世界モデルを選択するための意思決定枠組み.
ジェリー・フアン による 2026年4月22日
2026年にロボット研究を支配する世界モデルアーキテクチャは3つである:Dreamer v3,IRIS,TD-MPC2.それぞれは学習環境ダイナミクスに根本的に異なるアプローチをとっており,正しい選択は,あなたの課題,ハードウェア,データ,および展開要件に依存します.この記事は,その決定を助けるために実践者に焦点を当てた比較を提供します.
世界 の モデル パラダイグム: 迅速 な 復習
世界モデルでは,次の状況を予測し,現在の状態と行動を考慮して,将来の状態と報酬を予測します.訓練された後,モデルは学習したシミュレーターとして機能します. 代理人は,実際のロボットに触れずに,政策を学ぶために,行動を計画したり,安全を評価するために,世界モデル内の何千もの軌道を"想像"することができます. 詳細な紹介については,同行記事を参照してください. [ロボットの世界モデル:なぜ重要でどのように機能する]
この3つのモデルが3つのデザイン哲学を代表する:
- ドリーマー v3: ストカスティックな潜伏変数を持つ復古状態空間モデル.
- IRIS: 自動逆転変形器によってモデル化されたトークン化された観測と行動. 次のトークン予測によって学習します.
- TD-MPC2: MLPベースのシンプルな潜伏動力モデル.行動選択のためにオンラインモデル予測制御 (MPPI) を使用します.
建築 深層ダイビング
ドリーマー v3: 繰り返す状態空間モデル
Dreamer v3は,各タイムステップで2種類の状態を維持するリキュアントステートスペースモデル (RSSM) を使用する:GRUによって計算された決定的リキュアントステート h_t,およびカテゴリー分布からサンプリングされたストカスティック潜伏ステート z_t. 決定的な状態は長期的依存を捉える (これまでの話で起こったこと),ストカシスト状態は現在の状況 (モデルが確信していないこと) に関する不確実性を捉える.
完全なモデルは,共同で訓練された5つの構成要素で構成されています.
- 序列モデル: h_t = f(h_{t-1}, z_{t-1}, a_{t-1}) -- GRUが歴史を統合する
- 裏側で実際の観測を組み込む
- 予測する前は, o_t を見ずに z_t を予測する前です (想像力で使用されます)
- 解読器: 訓練信号の観測を再構築する
- 賞与/継続予測: ** r_t ~ p\ r_t h_t, z_t), c_t ~ p\ c_t √ h_t, z_t) - 賞与とエピソード継続を予測する
想像中,エンコードは使用されません (実際の観測はありません).ダイナミクス予測子は先の z_t をサンプル化し,シーケンスモデルは h_t を進み,アクターがアクションを選択します.批評家は,ランバダ・リターン推定器を使用して,アクター更新の利点を計算するために想像した軌道を評価します.
ストカスティック状態は32つのカテゴリー変数を使用し,それぞれ32つのクラスがあり,可能な32^32の異なる潜伏空間を与えます.この離散表示は,以前のバージョンにガウスの潜伏変数が影響を与えた後部崩壊問題を回避し,より鋭い,より情報提供的な表示を提供します.
IRIS: 象徴化された Autoregressive ワールドモデル
IRISは世界モデルをシーケンスモデリング問題として再考する.まずVQ-VAE(変分オートエンコーダ) (ベクトル量化変異自動エンコーダー) を訓練して,各観測フレームを固定数々の離散トークンに圧縮する (通常は512-1024のコードブックサイズでフレームあたり16-64トークン). 世界モデルは,以前の観測とアクショントークンをすべて考慮して,次のトークンを予測する自動逆転型トランスフォーマーです.
単一の移行の順序構造は
行動 行動 行動 行動 行動 行動 行動 行動 行動 行動 行動 行動 行動
変換器は,この平列の順序を因果注意で処理し,先のすべてのトークンから各トークンを予測します. これは,建築的にGPT式の言語モデリングに同類です. "言語"は,単語のトークンではなく,観察とアクショントークンだけです.
IRISのメリットとは,NLPで膨大な規模で検証されたトランスフォーマースケーリング特性を直接活用するという点である. VQ-VAE(変分オートエンコーダ)トークनाइゼーションは損失的である:コードブック解像度の下の空間細部が廃棄される.数ピクセルで異なるオブジェクトポジションを区別する必要があるタスクでは,これはボトルネックである可能性があります. 代証機の品質は 世界モデルの精度を 制限しています
TD-MPC2:オンライン計画による潜伏動力
TD-MPC2は,三つの方法の中で最もシンプルな建築アプローチを採用し,MLPベースの4つの構成要素を学習します.
- エンコード: h(o_t) -> z_t - 暗状態への観測を地図化する
- ダイナミックモデル: d(z_t, a_t) -> z_{t+1} -- 次の潜伏状態を予測する
- 報酬予測: R(z_t, a_t) -> r_t -- 即座報酬を予測する
- 値関数: Q(z_t, a_t) -> v --長期価値の推定 (TD学習)
繰り返すことも 注意もせず ストカスティックな潜伏変数もありません 標準的なフィード・フォアワードネットワークだけです モデル全体が端から端まで訓練されています 潜伏動力学の一貫性 (予測される次の潜伏は次の暗号化された観測と一致する) を組み合わせた 共同損失で タイム差 (TD) の値学習です
推論時に,TD-MPC2は学習されたポリシーを使用しません.代わりに,制御ステップごとにモデル予測経路統合 (MPPI) 計画を実行します.
- 標本 N 候補行動序列 (通常 N=512,視界=5ステップ)
- 予測された潜伏軌道を得るために,ダイナミックモデルを通して各シーケンスをロール
- 各軌道をスコアする:予測された報酬の合計 + Q関数からの終端値
- 行動配列の重量平均を計算する.
- 体重平均順序から最初のアクションを実行する
計画による推移の方法とは "政策"が暗示されるということです それは世界モデルと計画アルゴリズムの組み合わせから生まれるのです 柔軟性という大きな利点があります 展開時に報酬機能を変更できます 訓練を繰り返すことなく 費用は,制御ステップごとに ~10-50ms の計画が必要であり, GPU と計画視野に応じて制御周波数を ~20-100Hz に制限します.
比較 対象
| Dimension | Dreamer v3 | IRIS | TD-MPC2 |
|---|---|---|---|
| Representation | Discrete categorical latent (32x32) | VQ-VAE(変分オートエンコーダ) discrete tokens | Continuous latent vector |
| Temporal model | GRU recurrence | Causal Transformer attention | Single-step MLP (no history) |
| Action space | Continuous or discrete | Discrete (continuous requires binning) | Continuous (native) |
| Policy learning | Actor-critic in imagination | Actor-critic in imagination | Online MPPI planning (no explicit policy) |
| Training cost (200 episodes) | 6-24h on 1x RTX 3090 | 12-48h on 1x RTX 3090 | 2-12h on 1x RTX 3090 |
| Inference latency | ~1ms (policy forward pass) | ~5ms (autoregressive decoding) | ~10-50ms (MPPI planning loop) |
| Max control freq | ~100-500Hz | ~50-200Hz | ~20-100Hz |
| Imagination horizon | 15-50 steps (configurable) | Limited by context window | 3-10 steps (MPPI horizon) |
| Reward flexibility | Fixed at training time | Fixed at training time | Changeable at deployment time |
| Open-source repo | danijar/dreamerv3 (JAX) | eloialonso/iris (PyTorch) | nicklashansen/tdmpc2 (PyTorch) |
| License | MIT | MIT | MIT |
どの よう に 使う か
ドリーマー v3 を選択する
- ** 長い計画視野を持つ継続的な制御が必要です.** ドリーマーのRSSMは,禁止的な計算コストなしで15〜50歩先を想像できます.そして俳優・批評家はこれらの長い視野で最適化することを学んでいます.これは,ロボットが握手アプローチ,指の配置,そして調整されたシーケンスとして引き上げを計画しなければならない巧妙な操作のような作業のための最良の選択です.
- ** 証明された,文書化されたフレームワークが必要です.** Dreamer v3 は 150+ のタスクに適用され,ほとんどのドメインで実行可能な単一のハイパーパラメータセットが付属しています. コードベースはきれいで良好な維持です.
- あなたのアクションスペースは連続です. ドリーマーはガウス人俳優を通じて継続的なアクションをネイティブにサポートします. 隠しや diskretization は不要です.
- **あなたは実際のロボットでオンラインでRLをやっている.**ドリーマーのサンプル効率 (100~1000倍モデルフリー方法より) は,実際のロボットとの相互作用から数時間ではなく数週間で学ぶことができるということです.想像に基づくポリシー更新はリスクフリーです.データ収集だけが現実世界と相互作用します.
- JAXは,優れたGPU利用率を提供していますが,PyTorchよりも学問的な曲線が高くなります.PyTorchへのコミュニティポートは存在していますが,公式リリースに遅れることがあります.
IRIS を選択する
- あなたの行動は自然に離散またはあなたはそれらを離散することができます. IRISはすべてをトークンとしてモデル化します.したがって,動作空間が既に離散している場合 (グリッパー開封,ナビゲーションコマンド) または効果的に管理可能な数々のカテゴリーに組み込まれるときに最もうまく動作します.
- Transformerのスケーリングを利用したいです. 大規模なコンピューティングにアクセスでき,さまざまな作業に対応する世界モデルをスケーリングする場合は,IRISのアーキテクチャはスケーリングに最も自然に適しています.同じアーキテクチャは既定のTransformerのスケーリングレシピを使用して80Mから数十億パラメータまで成長することができます.
- あなたは生成型世界モデルに興味があります. IRISは自転的に観測トークンを生成しているため,同じアクションシーケンスのための様々な可能な将来のサンプルを採取できます. これは不確実性推定および下流政策のためのトレーニングデータを生成するのに役立ちます.
- あなたのタスクドメインが検証されました. IRISは主にアタリと単純な制御タスクで検証されました.あなたのロボットアプリケーションに連続で高次元アクションスペース (7-DOF腕 +グリッパー) が含まれる場合,注意深くプロトタイプして,アクションの diskretization がボトルネック性能を妨げないことを確認する必要があります.
TD-MPC2 を選択する
- ** 展開時に柔軟な報酬機能が必要です.** TD-MPC2 は世界モデルと学習値機能を活用してオンラインプランを作成しているため,テスト時に再訓練なしで報酬機能を変更できます. 新しいターゲットポジションを指定したり,衝突罰を加えたり,タスク目標を完全に変更したりします. プランナーは適応します. これは,実行時に目標が指定されたアプリケーションにおいて特に価値があります.
- TD-MPC2 の MLP ベースのアーキテクチャは,Dreamer より2
5倍,IRIS より510倍速く訓練されます. - 多くのタスクに単一のモデルが必要になります. TD-MPC2 は 104 つのタスクを解決する単一のモデルを実証しました (317M パラメーター"変数).もしあなたの展開は同じロボットで多くのタスク変異を伴う場合,単一の大きな TD-MPC2 モデルはタスクごとに独立したドリーマーモデルを訓練するよりもより実践的である可能性があります.
- あなたの制御周波数要求は10-50Hzです. MPPI計画ループは,学習されたポリシー前進パスと比較して遅延を加えますが,ほとんどの操作作業 (10-30Hz制御) では,10-50ms計画時間は受け入れられます.
- ** PyTorch を好む.** 参照実装は,最小の依存性を持つクリーンな PyTorch です.
既存のスタックと統合
ROS2 統合
3つのフレームワークのいずれもネイティブ ROS2 統合を搭載していませんが,それらを ROS2 ノードに包装することは簡単です.パターンは3つの場合も同じです:
rclpy import rclpy.node import Node from sensor_msgs.msg import JointState,Image from std_msgs.msg import Float64MultiArray class WorldModelNode(Node): def __init___self, world_model,planner): super(___init_('world_model_node') self.model = world_model self.planner = planner # 観測を購読する self.create_subscription 画像, '/camera/image_image', self.image_cb, 10) self.create_subscriptionJointplan, '/action_joint_states', self.joint_cb, self.b) # 自動制御 (self.control) * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * *
TD-MPC2では,プランナーは MPPI アルゴリズムである.Dreamerでは,学習したアクターネットワークである.IRISでは,学習したアクターまたはトークン化されたアクションスペースを検索する.ROS2統合の重要な違いは遅延である.Dreamerのアクター・フォワードパスが ~1msで完了する.TD-MPC2のMPPIループは10-50msを必要とします.これは制御タイマーを設定する方法に影響します.
レロボット統合
HuggingFaceの [LeRobot framework] (
レイロボット.common.datasets.lerobot_dataset import LeRobotDataset import numpy np # Load a LeRobot dataset = LeRobotDataset("lerobot/pusht") #Dreamer-compatible NPZ episodes for episode_idx in dataset.episode_data_stack[""から": episode = dataset.hf_dataset.filter(lambda x: x["episode_index"] episode_idx) ==\savez_compressedf"episodes/episode_{episode_idx}.npz",image=nstack\nstack\nstack\nstack\nstack\nstack\nstack\nstack\nstack\nstack\nstack\nstack\nstack\nstack\nstack\nstack\nstack\nstack\nstack\nstack\nstack\nsta
TD-MPC2では,その代わりにHDF5フォーマットに変換します.IRISでは,トランスフォーマーワールドモデルを訓練する前に,さらに観測画像の VQ-VAE(変分オートエンコーダ)トークナイザーを訓練する必要があります.
Gimnasium / MuJoCo 統合
3つのフレームワークは,Gymnasium (旧OpenAI Gym) 環境をネイティブまたは最小設定でサポートしています.これは実際のハードウェアに移行する前にシミュレーションでプロトタイプを簡単にします.
- ** ドリーマー v3:** 包装を通してDMControl,Atari,Minecraft,カスタムジムナジウムエンヴァースの内蔵サポート.
- IRIS: アタリ内蔵サポート. 運動場連続制御には,動作の解明のためにカスタマイズされた包装が必要です.
- TD-MPC2: DMControl, Meta-World, Maniskill,および MyoSuite の内蔵サポート.新しい Gymnasium envs を追加するには,タスク設定ファイル (10-20 行) を実装する必要があります.
モデルごとにデータ要件
軌道の種類
3つのモデルは軌跡データから学ぶが,異なる性質に敏感である.
- Dreamer v3は,明確な時間構造を持つ軌跡を必要とします.報酬予測器に校正するために負の例が必要であるため,成功と失敗の両方を含むエピソードから利益を得る.ランダム探索データは初期世界モデル予備訓練に有用である.タスク特有の示例はポリシーを改善します.
- IRISは,良いVQ-VAE(変分オートエンコーダ)コードブックを訓練するために多様な軌跡を必要とします.すべてのエピソードが視覚的に似ている場合,コードブックには新しい状況のカバーが悪いでしょう.視覚多様性を優先してください.異なるオブジェクトの色,位置,照明条件,カメラの角度.
- TD-MPC2は,学習された政策ではなくオンライン計画を使用しているため,データ品質に関して最も柔軟性がある.少し不正確な世界モデルであっても,MPPI計画では多くの候補者を評価することによって良い行動を発見することが多い.しかし,価値機能 (Qネットワーク) は,有用な端末値推定を提供するために十分なデータ覆盖が必要です.
観察の形態
| Modality | Dreamer v3 | IRIS | TD-MPC2 |
|---|---|---|---|
| RGB images | Native (CNN encoder) | Native (VQ-VAE(変分オートエンコーダ)) | Supported (CNN encoder) |
| Proprioception only | Supported (MLP encoder) | Requires state tokenization | Native (default modality) |
| Multi-camera | Concatenate or multi-encoder | Separate VQ-VAE(変分オートエンコーダ) per view | Concatenate encodings |
| Point clouds | Custom encoder needed | Not well-supported | Custom encoder needed |
| Force/torque | Concatenate with proprioception | Tokenize as additional modality | Concatenate with proprioception |
集の長さ
3つのモデルはエピソード長さを異なる方法で処理します
- Dreamer v3: 固定長さの次列 (通常50~64ステップ) で列車する.任意の長さのエピソードからサンプルを採取する.長編 (1000+ステップ) は大丈夫です. RSSMの再現状態は文脈を維持します.これはDreamerを長時間の操作作業に適しています.
- IRIS: トランスフォーマーのコンテキストウィンドウによって制限されています. 1024トークンコンテキストとフレームごとに 16トークン + 1アクショントークンで,約60トークンコンテキストを得ることができます.より長いエピソードには,長距離依存性を失う可能性のあるカットまたは割れ目が必要です.
- TD-MPC2: 短期間次列 (通常は5〜10ステップ) で訓練されるのは,ダイナミックモデルが単段階であり,Q機能はTD学習を通じて長期間のクレジット割り当てを処理しているため.エピソード長さは訓練に影響しませんが,MPPI計画視界は通常3〜10ステップのみなので,プランナーは長時間課題のためにQ機能に依存します.
コード クイックストア
夢見る V3
#インストール (JAX + GPU) pipインストール jax[cuda12] jaxlib dreamerv3 # DMControl Reacher python dreamerv3/main.py \ --configs dmc_vision \ --task dmc_reacher_easy \ --logdir ./logdir/reacher \ --steps 500000 # トレーンでカスタムロボットデータ (NPZ形式) python dreamerv3/main.py \ --configs dmc_vision \ --task_logbot \ --logdir ./logdir/custom \ --data_dir /path/to/npz\episodes/ \ --steps 1000000
IRIS
# git clone
TD-MPC2
# インストール pip インストール tdmpc2 # DMControl Walker python train.py 任務=犬走モデル_size=48ステップ=10000000 # 80 DMControl tasks python train.py 任務=mt80モデル_size=317ステップ=25000000バッチ_size=1024 # MPPI 計画で評価 python evaluate.py 任務=犬走チェックポイント=/path/to/model.pt \ num_samples=512 horizon=5
失敗する 常識 方法
世界 の モデル は 未来 の 模糊 な 予測 を している
症状: 解読された想像上の観測は,複数の妥当な結果の平均のように見えます.物体は幽霊的または複製的に見える.
診断: モデルの潜伏空間は多模様性を捕捉していない. ガウス潜伏変数 (ドリーマー v1/v2) や小規模なVQ-VAE(変分オートエンコーダ)コードブック (IRIS) に共通している.
修正: Dreamerでは,ガウス式ではなく v3 の分別的カテゴリーラテンツを使用していることを確認してください.IRISでは,VQ-VAE(変分オートエンコーダ) コードブックサイズ (1024 または 2048) とフレーム દીઠトークン (32 または 64) を増加してください. TD-MPC2では,ラテンツスペースがタスク条件付きで観測を再構築する必要がないため,これは問題ではありません.
政治 は 世界 の 模範 の 不正確 を 活用 し て い ます
症状: 政策は想像上の高い報酬を達成しますが,実際のロボットでは失敗します. 世界モデルに"故障"が見つかりました. 予測された報酬が高い状態のアクションシーケンスですが,実際の物理とは一致しません.
診断: 政策は,世界モデルが不正確である国家行動領域に移行し,その不正確性を利用している.
修正: (1) 35つの世界モデルをまとめて,集合予測が異なった国を訪れる政策を罰せること. (2) 複合誤差を減らすために想像の視界を縮小すること. (3) 政策が機能している地域においてより実在的なデータを収集し,世界モデルを再訓練すること. TD-MPC2では,MPPI計画視界は既に短く (310ステップ) で,これはより少ない.
VQ-VAE(変分オートエンコーダ)コードブック崩壊 (IRIS)
症状: コードブックエントリのほんのわずかな割合しか使えません.再構築された観測は詳細がない.
診断: VQ-VAE(変分オートエンコーダ)の訓練は,コードのサブセットを使用することに崩壊しました.これはVQ-VAE(変分オートエンコーダ)のよく知られている問題です.
修正: (1) 格レーデントベースのコードブック更新ではなく,指数移動平均 (EMA) を使用する. (2) コードブックサイズを増やす. (3) コードブックリセットを追加する:コードコード出力分布から使用されていないコードを定期的に再起動する. (4) コミットメント損失重量0.25 (IRISのデフォルト) を使用する.
TD学習不安定性 (TD-MPC2)
症状: Q値が訓練中に異動するまたは振動する.MPPIプランナーは不規則な動作を生む.
診断: 値関数に対する時間の違い学習は不安定で,しばしば学習率が高く,またはターゲットネットワーク更新頻度が不足している.
修正: (1) Q関数の学習速度を減らす (1e-3の代わりに 3e-4 を試す). (2) 目標ネットワークソフトアップデート系数 tau を0.01 から0.005 に増やす (よりスムーズなアップデートのために). (3) Qネットワークにレイヤの正常化を追加する. TD-MPC2 のデフォルトハイパーパラメータは一般的に安定しているので,変更する場合,まずデフォルトに戻る.
十分なデータ多様性
症状: 世界モデルは訓練のような状態について正確な予測をしますが,少し異なる初期設定では惨めな失敗です.
診断: データセットには初期状態,オブジェクト構成,環境条件の十分な変動がない.
修正: これはデータ問題ではなくモデル問題です. 意図的にランダム化された初期条件を持つエピソードを多く収集します.RCSVの データ収集サービス は,世界モデルトレーニングのために国家空間覆盖を最大限に拡大するために特別に設計された構造化されたランダム化プロトコルに従います. 原則として,データセットは,展開時に期待する変動範囲の3~5倍をカバーする必要があります.
関連 読書
- [ロボットのための世界モデル:なぜ重要なのか] (T3
) - 世界モデルへの包括的な紹介 - [世界モデルをはじめ] ステップ・バイ・ステップ・実践教程
- [ロボット学習の分散政策] (
T5 ) -- 補完政策構造 - LeRobot フレームワーク Guide -- 世界モデルと互換性のあるデータセット形式
- [ロボット訓練データとは何か?]
- RCSVデータサービス - 世界モデル訓練のための軌跡データセット







