Blogに戻る

ロボット の 世界 の モデル: なぜ 重要 で ある か と どの よう に 機能 する か

ロボット学の世界モデルとは? ドリーマー,IRIS,TD-MPC2のような学習されたダイナミックモデルが想像力に基づく計画,シム-トゥ-リアル転送,安全検証を通じてサンプル効率的なロボット学習を可能にする方法について学びましょう.

ジェリー・フアン による 2026年4月22日

世界モデルは行動から将来の状態を予測する学習動力モデルで ロボットは現実世界での実行前に想像力の中で計画し,探索し,行動を検証することができます ロボット学習スタックの中心に急速に成長し モデルベースの方法のサンプル効率とディープ・ラーニングの表現力との間のギャップを埋めるのです この記事では,その構造がどんなものなのか,主要建築の違い,プロジェクトに1つが必要かどうかをどのように決定するかについて説明します.

世界 の モデル は 何 です か

世界モデルとは,データから環境の動態を学ぶ神経ネットワークである.現在の状態 (または観察) とアクションを考慮すると,モデルは次の状態,報酬,そしてオプションとしてエピソードが終了したか予測する. これは新しい考えではありません モデルベースの強化学習は 何十年にもわたって存在してきましたが ディープラーニング 大規模データと現代的なシーケンスのモデリングの組み合わせにより 2020年以降 世界モデルは 劇的により能力が向上しました

公式には,世界モデルはマルコフの意思決定プロセスの移行関数 T ∈ S, r ∈ S, a に近似する.実際,ほとんどの現代世界モデルは,原始観測ではなく,学習された潜伏空間で動作する.モデルには3つの構成要素があります.

  • エンコード: 原始観測 (画像, proprioception,点雲) をコンパクトな隠された表現 z_t に映し出します.
  • ダイナミックモデル: 現在の潜在状態 z_{t+1} とアクション a_t を考慮して次の潜在状態 z_{t+1} を予測する.これは世界モデルの核である.
  • デコダース (decoder): 観測を再構築し,報奨を予測し,潜伏状態からエピソード終了を予測する.これらは訓練信号を提供し,想像した軌道の評価を可能にします.

世界モデルが有用になるのは ダイナミックモデルが訓練されたら 想像力の中で"ロールアウト"できるということです リアルロボットに触らないうちに 何千もの軌道をシミュレートできます 学習したモデルの中で 計画や政策最適化,安全検証を完全に可能にします

ロボット は なぜ 世界 の モデル を 必要 と する の です か

モデルフリー強化学習 (RL) 方法であるPPOとSACは試行錯誤によって学習し,何百万人もの環境相互作用が収束する必要があり,シミュレーションでは,これは単に高価である.実際のハードウェアでは,それは不実用で危険です.ランダムに探査するロボット腕は物体と衝突し,エンドエフェクタにダメージを与え,壁時計時間の数週間を無駄にする. 世界モデルでは この根本的な瓶頸を 4つのメカニズムで解決します

1.サンプル効率

世界モデルは現実世界の相互作用からより多くの学習信号を抽出する.値関数を更新するために一度の移行 (s, a, r, s') を使用する代わりに,世界モデルはそれをトレーニングデータとして保存する.モデルが十分に正確であるならば,エージェントはモデルをロールアウトすることによって無制限の合成体験を生成することができます. 例えばドリーマー v3は Atari ゲームを 200Kの環境フレームから学びます モデルフリーメソッドには 50-200Mのフレームが必要です サンプル効率の 100-1000倍向上です ロボティクスでは それぞれのフレームがリアルタイムでハードウェアの実際の磨損を伴うので この違いは存在感的です

2 計画と見出し

精密な世界モデルによって,ロボットが1つにコミットする前に候補行動序列を評価することができます.学習したダイナミクスモデルを持つモデル予測制御 (MPC) は: (1) N候補行動序列を提案し, (2) 世界モデルを通してそれぞれをロールアウトし, (3) 予測された累積報酬によってそれぞれの軌道をスコアし, (4) 最高軌道を介して最初のアクションを実行することによって動作します. この計画ループは 制御のあらゆるステップで繰り返され 反応的な政策が欠けている 慎重な推論の形を与えます

3 セキュリティ検証

リアルロボットにポリシーを導入する前に 危険状態をチェックする世界モデルで展開できます 衝突 合同制限違反 過剰な力 作業場制限違反 これは物理シミュレーションよりも速く 安くなります なぜなら世界モデルは GPUで ステップごとに 単一の前進パスとして実行され 接触動力解析器のオーバーヘッドなしで 世界モデルは実際のデータから学び,分析的にシミュレーションするのが難しい現象 (ケーブル動態,柔らかいオブジェクト変形,センサーノイズ) を捕捉しているため,手調シミュレーションよりも現実的です.

4. シムからリアルへの転送

リアルロボットデータで訓練された世界モデルは 実力的なダイナミクスと本質的に一致する学習したシミュレーターとして機能します 物理的なシミュレーションと現実の不一致は シミュレーション訓練されたロボット政策の 主要な失敗モードです リアルデータ (1-10時間間のインタラクション) のわずかな量でも訓練された世界モデルでは,ケーブルルーティング,変形可能なオブジェクト操作,さまざまな表面の摩擦,コンパクトな接触など,シミュレーションが悪名高いダイナミクスを捕捉することができます.正確な世界モデルの中で最適化されたポリシーが,MuJoCoまたはIsaac Simで訓練されたポリシーよりもドメインギャップが少ないリアルロボットに転送されます.

重要な建築物

ロボット学者のために 最も重要な建築です. ロボット学者は,

夢見る者 (v1, v2, v3) -- ハフナー等, 2020-2023

ドリーマーとは,最も成熟し広く使用されている世界モデルフレームワークである. 決定的な再帰状態 (歴史を捕捉する) とストカスティックな潜伏状態 (不確実性を捕捉する) を維持するリキュートステート・スペースモデル (RSSM) を学習する. 代理人は,世界モデルの想像的な軌跡の中で,完全に俳優批判的政策を学び,最初のデータ収集段階以降,現実環境でRLを行う必要はなく.

ドリーマー v3 (2023) はいくつかの重要な改善を導入しました. 報酬と値正常化のためのシンログ予測は,非常に異なる報酬スケールを持つタスク,分別の潜伏表現 (32つのカテゴリー変数それぞれ32クラス = 1024次元分別コード) と,調節なしで150以上のタスクで動作する統一されたハイパーパラメータセットです. 世界初のモデルエージェントで マイナクトにダイヤモンドをゼロから集めました 作業には様々なゲームステートで 何百もの連続的な決定が必要でした

ロボティクスでは,ドリーマー v3はデフォルトの出発点である.自然に連続制御を処理し,微小なGPU予算 (単一のRTX 3090) でトレーニングし,実際のロボット操作,移動,ナビゲーションタスクに成功に適用されている.その主要な制限は長視線複合エラーである.正確な予測の200+ステップを必要とするタスクでは,想像した軌跡は現実から漂っている.

IRIS -- Micheli et al., 2023

IRIS (Internal Speech 上での自動逆転による想像) は,完全に異なるアプローチをとる.VQ-VAE(変分オートエンコーダ) を使用して観測と行動を分断トークンに代証する.その後,自動逆転型トランスフォーマーで関節配列をモデル化する.世界モデルは,本質的に,GPT型の次回トークン予測器である.

このアーキテクチャは大きな言語モデルのスケーリング特性を受け継ぐ.モデルサイズとデータを増やすると予測品質は予測可能な形で向上します.IRISは,わずか100Kの環境相互作用を使用したアタリゲームのうち10ゲームで超人性能を達成しました.ドリーマー v3に比べてもスケーリングがより容易なアーキテクチャです.

妥協点は,VQ-VAE(変分オートエンコーダ)によるトークナイン化により損失圧縮が導入される.精密な操作のために重要な細粒度な空間情報 (螺栓頭の正確な位置,接続機の方向) は,離散ボトルネックで失われる可能性があります.サブミリメートル精度を必要とするロボット作業では,これは本当の懸念です. 移動,移動,粗略な操作のために,トークン化された表現は十分であり,スケーリング特性も魅力的です.

TD-MPC2 -- ハンセン等, 2024

TD-MPC2 (モデル予測制御のための時間差学習,バージョン2) は,学習された潜伏動力学モデルと推論時にモデル予測制御を組み合わせています.想像力における独立した俳優批判者を訓練するドリーマーとは異なり, TD-MPC2 はモデル予測経路統合 (MPPI) アルゴリズムを通じてオンライン計画のために世界モデルを直接使用します. 制御ステップごとに アクションシーケンスをサンプルし ダイナミックモデルを通して ロールアウトし 学習された値関数を使用して スコアを付け そして最高の最初のアクションを実行します

TD-MPC2の重要な貢献は,単一のハイパーパラメータセットと単一のモデルアーキテクチャが,移動,操作,ナビゲーションを網羅する104つの連続制御タスクを解決できることを示しています.このモデルは,共同で学習されたエンコード,ダイナミック,報酬,および値関数を持つMLPベースの単純な潜伏動力学モデル (再発,注意がない) を使用します. 簡単なことで 訓練が速く 推論が速くなります

ロボット学では,MPPI計画ループは,ダイナミックモデルを再訓練せずに,変化する目標 (報酬機能を変更するのみ) を処理します. 目的が部署時に変化する 目的の位置や 捉え方要求や 人間が指定した目的の 異なる 目的の位置などに適しています

ユニシム -- 陽等, 2024

UniSimは,行動に左右された将来の観測のリアルなビデオを生成する"ユニバーサルシミュレーター"です.ビデオ拡散モデルアーキテクチャに基づいて,単一のモデルから多様な環境 (室内,室外,操作,ナビゲーション) をシミュレートすることができます. 重要な洞察は インターネット規模のビデオデータには 暗黙の物理が含まれています 物体が落ちて流体流れる ドアが揺れる 十分な大きさの生成モデルが 物理学の明示的な監督なしに この動態を 学ぶことができます

UniSimは潜伏空間ではなくピクセル空間で動作し,直接解釈可能な写真現実的な将来のフレームを表示できる.これは計画軌道を人間によって検査し,下流視力に基づく政策を訓練するのに役立ちます. しかし,ピクセル空間生成は計算的に高価である.256x256で16フレームの展開を生成するにはA100で2秒かかります.

ユニシムの役割は,リアルタイムプランナーではなく,データ増やし,ポリシー評価ツールとして機能する.合成トレーニングエピソードを作成したり,新しい状況でポリシーが何を行うか,または導入前に安全性を評価したりするために使用できます.

ジーニアス / ジニアス2 - ブルース等, 2024

Genie (Generative Interactive Environments) は,インターネット規模のビデオで訓練されたGoogle DeepMindの基礎世界モデルである.Genie 2は,単一の画像プロンプトから一貫した制御可能な世界シミュレーションを生成し,3D環境まで拡張する.タスク特有の世界モデルとは異なり,Genieは特定のドメインに細かく調節できる汎用環境生成器として設計されています.

ロボットにとって,Genieは,先程訓練された基礎モデルとして重要だ.ロボットデータ (インタラクションの10-100時間以上を必要とする) で世界モデルをゼロから訓練する代わりに,Genieは少量のドメイン特定データで細かく調整し,物理と空間関係に関する以前の知識を活用することができます. このパラダイム - 基礎世界モデル + ドメインの調整 - は 基礎言語モデルの成功を反映し 2026~2027年に この分野が進む方向性です

潜伏空間対ピクセル空間世界モデル

これは世界モデルを建設する際に 最も重要な建築決定です 妥協は大きくあります

Property Latent-Space (Dreamer, TD-MPC2) Pixel-Space (UniSim, Genie)
Rollout speed ~0.1ms per step (GPU) ~50-200ms per step
Planning compatibility Real-time MPC feasible Offline planning only
Human interpretability Low (latent vectors are opaque) High (viewable video frames)
Spatial precision Task-dependent (can be high) Limited by generation resolution
Training compute Single GPU (hours-days) Multi-GPU cluster (days-weeks)
Data efficiency Good (100K-1M frames) Poor (needs millions of frames or pre-training)
汎化 Narrow (domain-specific) Broad (foundation models generalize across domains)
Best use case Real-time control + online RL Data augmentation + offline evaluation

**実用的な推奨事項:2026年のほとんどのロボット工学プロジェクトでは,潜在空間世界モデル (Dreamer v3または TD-MPC2) を主なダイナミクスモデルとして使用します.安全レビューまたは関係者とのコミュニケーションのために,人間の検査可能な展開が必要であれば,潜在軌跡をビデオに変換するピクセル空間デコーダーを追加してください. 必要な時にピクセル空間視覚化を解釈できる速度で 暗空間計画が速くなります

訓練データ要件

世界モデルが訓練されているデータと同じくらい良い.これは世界モデルパフォーマンスにおいて最も重要な要素であり,この分野に新興したチームによって最も過小評価される要素です.

どんな データ

世界モデルには移行ツープルが必要 (観測_t,アクション_t,報酬_t,観測_{t+1},完成_t). ロボット学では,観測は通常以下を含む:

  • RGB画像 (腕に搭載された,上部,または両方) から. 64x64から 256x256までの解像度は標準です.より高い解像度により,ほとんどの作業では,比例的に利益を得ずにトレーニングコストが増加します.
  • **プロピオセプティブ状態:**関節位置,速度,グリッパー状態,エンドエフェクター姿勢.常にこれを含みます. 騒音な視覚観測を補完する正確な状態情報を提供します.
  • アクション: 各時間ステップでロボットに送られたコマンド.武器の場合,これは通常,共同速度またはエンドエフェクターデルタコマンドです.アクション表示は,部署ポリシーが出すものと一致する必要があります.
  • 報酬 (オフライントレーニングのオプション):タスク完了信号,目標までの距離,または稀な成功指標. ダイナミックモデルを予備訓練するために必要ではなく,政策の最適化に不可欠です.

データの量

データ要求は,建築と作業の複雑性によって異なります.

  • ドリーマー v3: 50-200エピソード (10K-50K 移行) 単作業操作. 500-2000エピソード 多作業または複雑な接触豊かな作業.
  • TD-MPC2: ドリーマーに似ています. 操作のために20〜50話までで効果的に計画を開始できます. 簡単な作業に到達するには,複雑な作業は200+が必要です.
  • IRIS: VQ-VAE(変分オートエンコーダ)トークナイザー訓練によりデータに飢えている. ドリーマーが等価なパフォーマンスに必要な予算の2-3倍.
  • UniSim/Genie: インターネット規模データに関する予備訓練が必要です. 基礎モデルが強ければ,ドメイン特有のデータでの精細調整は50-500話で動作できます.

質量 より も 大事 な もの

低品質データでは,世界モデル訓練に積極的に害を加えています.

  • 不一致な制御周波数: データ収集が変速率 (10Hz 時には30Hz) で実行されている場合,ダイナミックモデルは不一致な時間関係を学んでいます.常に固定周波数で記録し,必要に応じてダウンサンプルの取得します.
  • **状態アクションの誤った配列:**観測時間スタンプとアクション時間スタンプが適切に同期されない場合,モデルは誤った動態を学習します.ハードウェア時間スタンプを使用する,ソフトウェア時間スタンプではありません.
  • 状態の覆いが不十分: 一つの初期設定から始まる1000エピソードで構成されたデータセットは,異なる初期状態を持つ200エピソード未満です.世界モデルは観察した動態のみを予測できます.
  • ** 破損したエピソード:** ハードウェア問題 (エンコードドリフ,通信ドロップ,グリッパー機能不全) によって任務が失敗したエピソードは,世界モデルに間違った動力学を教えます.これらのフィルタを外します.

現行の制限

世界 の モデル は 力 に 満ち て いる が,解決 さ れ て い ない 問題 です.現実 的 な 期待 を 設定 する ため に,その 限界 に つい て 正直 な こと が 必須 です.

誤り を 増やす

世界モデル予測には何らかのエラーがあります. 100以上のステップでモデルを展開すると,これらのエラーが複合されます. それぞれの予測は,地面上の真実ではなく,以前の予測に基づいています.ステップ200までに,想像された軌道は実際に起こるものとほとんど似ていない可能性があります.これは現在のモデルのために効果的な計画視界を約20-50ステップに制限します (10Hz制御で2~5秒). 長期計画視界を必要とする課題には階層的なアプローチや実際の観測に定期的な再アレンジが必要である.

配分シフト

訓練中に見た状態の空間における モデルが正確であるだけです モデルがこれまで見たことがない状態を モデルが調査している場合― モデルが新しいオブジェクト構成や 異常な衝突状態や 異なる照明状態を 予測する時は 不確実になります さらに悪いことに,政策は世界モデルにおける不正確性を利用し,現実に移転しない"想像上の"高報酬軌道を発見することが学ぶことができます.アンサンブルベースの不確実性推定 (複数の世界モデルを訓練し,予測不一致を測定する) は,不確実な予測をマークすることによって部分的にこれを緩和します.

長期 の 忠誠

配分中でも,世界モデルは接触に富んだ相互作用の長い連続で苦労します. 3つのブロックを積み重ねること,複数のガイドを通してケーブルを編み込むこと,または複数の部品のメカニズムを組み立てることには,それぞれ数百の接触イベントを順序的に正確に予測する必要があります. 現在の世界モデルは短距離の接触列 (握り,押す,挿入) を処理できるが,拡張された多段階の組み立て作業で劣化する.これは活発な研究領域です.

オンライン 計画 の 費用 を 計算 する

世界モデルによるMPC型計画には,制御ステップごとに数百の候補軌道を展開する必要がある.MPPIを持つTD-MPC2では,制御ステップごとに512の展開 × 5のステップ = 2560の動力モデル前進が通過する.RTX 4090では,これは15Hzで動作する.これは多くの操作作業に適しているが,高周波移動制御には十分ではない. 減価計画 (プランナーを反応性政策に蒸留させる) は 100Hz+に達できるが,追加の訓練が必要である.

世界モデルがVLAと拡散政策を補完する方法

世界モデルはビジョン・言語・行動 (VLA) モデルや拡散政策の代わりではありません.ロボット学習スタックで異なる層を占め,これらの政策アーキテクチャと組み合わせると最も強力です.

世界モデル + VLA: RT-2やOctoのような VLAは視覚観測や言語指示からアクションを生成します.世界モデルは検証者として機能します.ロボットが VLAの提案されたアクションを実行する前に,世界モデルは結果をシミュレーションし,安全違反を確認します. 予想された結果が危険である場合 (衝突,過剰な力) は,システムは行動を拒絶し,代替案を求めることができます.これはチェスのエンジンが世界モデル (ゲームルール) を使用して候補者の動きを評価する方法に類似します.

**世界モデル +拡散政策:**拡散政策は,学習された分布からサンプルを採取することによって,多様な行動軌道を生成する.世界モデルでは,これらの候補者を予測した結果品質によって評価し,最も成功する可能性のある軌道を選択することができます.これは,拡散政策の多様式表現性を世界モデルの前向き評価と組み合わせます. 実践的には,これは8〜16人の候補者軌道を生成するために 拡散政策の否定プロセスを実行し,それぞれ世界モデルを介してローリングし,最も高い予測された報酬を持つものを実行することを意味します.

データ増強のための世界モデル: おそらく最も実用的な短期的な利用:収集したデータで世界モデルを訓練し,その後それを下流VLAまたは拡散ポリシーのための合成トレーニングエピソードを生成するために使用します.これは追加のデータ収集ではなく GPU計算コストで3-10倍の効果的なデータセットサイズになります. 合成データは,実データ (通常は50~80%合成,20%~50%実データ) と混ぜて,基礎を保つ必要があります.

実践的な比較:ドリーマー v3 vs IRIS vs TD-MPC2 vs UniSim

Property Dreamer v3 IRIS TD-MPC2 UniSim
Architecture RSSM (GRU + stochastic latent) VQ-VAE(変分オートエンコーダ) + autoregressive Transformer MLP encoder + MLP dynamics Video diffusion (U-Net or DiT)
Parameters ~20M (S), ~100M (L), ~200M (XL) ~80M (base), ~300M (large) ~5M (S), ~19M (M), ~317M (L) ~1-3B
Data needs (single task) 50-200 episodes 200-500 episodes 50-200 episodes Pre-trained + 50-500 fine-tune episodes
Training GPU 1x RTX 3090 (6-24h) 1x RTX 3090 (12-48h) 1x RTX 3090 (2-12h) 8x A100 (days-weeks)
Inference speed ~50us/step (imagination) ~1ms/token ~0.1ms/step (latent rollout) ~100-200ms/frame
Primary task domains マニピュレーション, locomotion, games Atari, discrete-action domains Continuous control (manipulation, locomotion) Navigation, manipulation (visual)
Key strength Universal hyperparameters, robust Scaling properties, discrete tokens Fast training, flexible reward Photorealistic, broad generalization
Open-source Yes (danijar/dreamerv3) Yes (eloialonso/iris) Yes (nicklashansen/tdmpc2) No (research preview only)

RCSVへの接続:世界モデル訓練のためのデータ収集

優れた世界モデルを構築することは,良いデータから始まります.RCSVの [データ収集サービス]T0) は,世界モデルに必要な高品質で多様な同期軌道データを生成するために設計されています. 私たちの収集パイプラインは固定周波数記録 (50Hz) とハードウェアタイムスタンプ付きの状態アクションの調整,およびエピソード間の構造的な変化 (ランダム化されたオブジェクト位置,多様なアプローチ戦略,多様な初期設定) を確保します.

世界モデルを訓練するチームでは,Dreamer v3 (NPZエピソード),TD-MPC2 (HDF5) と HuggingFace LeRobotエコシステム (Parquet + video) に互換性のあるフォーマットでデータセットを提供しています.各データセットには,プロピオセプティブ状態 (関節位置,速度,グリッパー状態),マルチビュー RGB (腕首 + 640x480のオーバーヘッドカメラ) と校正アクションレーベルが含まれています.

世界モデルプレトレーニングは特にデータ多様性から恩恵を受けています 様々なシナリオやオブジェクトや操作戦略をカバーするエピソードです [公開データセット] 特定のタスクに精細調整する前にプレトレーニングデータとして機能する 50以上のオブジェクトカテゴリーで操作エピソードが含まれます 世界モデル訓練を中心としたカスタムデータ収集キャンペーンについては [我々のチームに連絡してください]

関連 読書

  • Dreamer vs IRIS vs TD-MPC2 --世界モデルを選択するための詳細な比較
  • [世界モデルから始め] T4) - コードの実践的なチュートリアル
  • [ロボット学習のための拡散政策] (T5) - 拡散政策が世界モデルを補完する方法
  • VLAモデル説明 --ビジョン・言語・アクションモデルと世界モデル統合
  • [ロボット訓練データとは何か?] モデル訓練のためのデータ品質基準
  • RCSVデータサービス - 世界モデル訓練のための軌跡データセット
  • 公開データセット --利用準備が整った操作データセット