Volver a Blog

Dreamer vs IRIS vs TD-MPC2: Elegir un modelo mundial para tu robot

Dreamer v3, IRIS y TD-MPC2 compararon cara a cara. Diferencias de arquitectura, costos de capacitación, velocidad de inferencia, integración con ROS2 y LeRobot, y marco de decisión para elegir el modelo de mundo adecuado para su proyecto de robótica.

Por Jerry Huang · 22 de abril de 2026

Tres arquitecturas de modelos mundiales dominan la investigación robótica en 2026: Dreamer v3, IRIS y TD-MPC2. Cada una adopta un enfoque fundamentalmente diferente a la dinámica del entorno de aprendizaje, y la elección correcta depende de su tarea, hardware, datos y requisitos de implementación. Este artículo proporciona una comparación centrada en los profesionales para ayudarlo a tomar esa decisión.

El modelo mundial: un resumen rápido

Un modelo mundial aprende a predecir lo que sucederá después: dado el estado actual y una acción, predice el estado futuro y la recompensa. Una vez entrenado, el modelo sirve como un simulador aprendido. Un agente puede "imaginar" miles de trayectorias dentro del modelo mundial para aprender una política, planificar acciones o evaluar la seguridad - todo sin tocar al robot real. Para una introducción completa, vea nuestro artículo de acompañamiento: [Modelos mundiales de robótica: por qué importan y cómo funcionan]

Los tres modelos comparados aquí representan tres filosofías de diseño distintas:

  • Dreamer v3: Modelo recurrente del estado-espacio con variables latente estocásticas. Aprende una política de actor-crítica en la imaginación.
  • IRIS: Observaciones y acciones tokenizadas modeladas por un transformador autoregresor. Aprende por predicción de tokens siguientes.
  • TD-MPC2: Modelo de dinámica latente simple basado en MLP. Utiliza el control predictivo de modelos en línea (MPPI) para la selección de acciones.

Arquitectura de buceo profundo

Dreamer v3: Modelo del Estado-espacio recurrente

Dreamer v3 utiliza un Modelo de Estado-Espacio Recurrente (RSSM) que mantiene dos tipos de estado en cada paso de tiempo: un estado recurrente determinista h_t calculado por un GRU, y un estado latente estocástico z_t muestrado de una distribución categórica. El estado determinista captura dependencias a largo plazo (lo que ha ocurrido en el episodio hasta ahora), mientras que el estado estocástico captura la incertidumbre sobre la situación actual (lo que el modelo no está seguro de).

El modelo completo consta de cinco componentes formados conjuntamente:

  • Modelo de secuencia: h_t = f(h_{t-1}, z_{t-1}, a_{t-1}) -- GRU que integra la historia
  • ** Codificador: ** z_t ~ q\_t √ h_t, o_t) -- posterior que incorpora la observación real
  • ** Predictor de dinámica: ** z_t ~ p\ z_t h_t) -- previo que predice z_t sin ver o_t (utilizado en la imaginación)
    • Descodificador: * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * * *
  • ** Predectores de recompensa / continuación: ** r_t ~ p\r_t h_t, z_t), c_t ~ p\ c_t

Durante la imaginación, el codificador no se utiliza (no hay observaciones reales). El predictor de dinámica muestra z_t del anterior, el modelo de secuencia avanza h_t, y el actor selecciona acciones. El crítico evalúa trayectorias imaginadas para calcular las ventajas de las actualizaciones de actores utilizando un estimador de retorno de lambda.

La elección clave de diseño en v3: el estado estocástico utiliza 32 variables categoricas, cada una con 32 clases, dando un espacio latente discreto de 32^32 estados posibles. Esta representación discreta evita problemas de colapso posterior que plagaron a versiones anteriores con variables latente gaussianas y proporciona representaciones más nítidas e informativas.

IRIS: Modelo mundial autoregresista tokenizado

IRIS repensas el modelo mundial como un problema de modelado de secuencias. Primero entrena a un VQ-VAE (Vector Quantized Variational Codificador Automático) para comprimir cada marco de observación en un número fijo de tokens discretos (generalmente 16-64 tokens por marco en un tamaño de código de 512-1024). El modelo mundial es entonces un transformador autoregresista que predice el siguiente token dado todos los tokens de observación y acción anteriores.

La estructura de secuencias para una sola transición se parece a:

[obs_tokens_t] [action_token_t] [obs_tokens_{t+1}] [action_token_{t+1}] ...

El Transformer procesa esta secuencia plana con atención causal, prediciendo cada token de todos los tokens anteriores. Esto es arquitectónicamente idéntico al modelado de lenguaje al estilo GPT - el "lenguaje" es solo tokens de observación y acción en lugar de tokens de palabras.

La ventaja de IRIS es que aprovecha directamente las propiedades de escala de Transformer que se han validado a gran escala en PNL. La desventaja es que la tokenización VQ-VAE es perdida: se descartan detalles espaciales por debajo de la resolución del libro de código. Para tareas que requieren distinguir entre posiciones de objetos que difieren en unos pocos píxeles, esto puede ser un cuello de botella. La calidad del tokenizer establece efectivamente un límite en la precisión del modelo mundial.

TD-MPC2: Dinámica latente con planificación en línea

TD-MPC2 adopta el enfoque arquitectónico más simple de los tres. Aprende cuatro componentes basados en MLP:

  • Encodificador: h(o_t) -> z_t -- mapas de las observaciones a estados latentes
  • Modelo de dinámica: d(z_t, a_t) -> z_{t+1} -- predice el próximo estado latente
  • ** Predictor de recompensa:** R(z_t, a_t) -> r_t -- predice la recompensa inmediata
  • Función de valor: Q(z_t, a_t) -> v -- estima el valor a largo plazo (aprendizaje TD)

No hay recurrencia, no hay atención, no hay variables latente estocásticas, solo redes de transmisión estándar. Todo el modelo está entrenado de extremo a extremo con una pérdida conjunta que combina la consistencia de dinámica latente (el predicido siguiente latente debe coincidir con la siguiente observación codificada), predicción de la recompensa y aprendizaje de valor de diferencia temporal (TD).

En el momento de la inferencia, TD-MPC2 no utiliza una política aprendida. en cambio, realiza la planificación de la ruta integral predictiva (MPPI) en cada paso de control:

  1. Muestra de secuencias de acción candidatas N (tipo N=512, horizonte=5 pasos)
  2. Rolla cada secuencia a través del modelo de dinámica para obtener trayectorias latentes predichas
  3. Puntuación de cada trayectoria: suma de las recompensas previstas + valor terminal de la función Q
  4. Calcule una media ponderada de las secuencias de acción, ponderada por puntajes exponenciados
  5. Ejecutar la primera acción desde la secuencia media ponderada

Este enfoque de planificación a la inferencia significa que la "política" es implícita - emerge de la combinación del modelo mundial y el algoritmo de planificación. El principal beneficio es la flexibilidad: se puede cambiar la función de recompensa en el momento de la implementación sin reentrenar nada. El costo es que la planificación toma ~10-50ms por paso de control, lo que limita la frecuencia de control a ~20-100Hz dependiendo de la GPU y el horizonte de planificación.

Comparación entre cabezas

Dimension Dreamer v3 IRIS TD-MPC2
Representation Discrete categorical latent (32x32) VQ-VAE discrete tokens Continuous latent vector
Temporal model GRU recurrence Causal Transformer attention Single-step MLP (no history)
Action space Continuous or discrete Discrete (continuous requires binning) Continuous (native)
Policy learning Actor-critic in imagination Actor-critic in imagination Online MPPI planning (no explicit policy)
Training cost (200 episodes) 6-24h on 1x RTX 3090 12-48h on 1x RTX 3090 2-12h on 1x RTX 3090
Inference latency ~1ms (policy forward pass) ~5ms (autoregressive decoding) ~10-50ms (MPPI planning loop)
Max control freq ~100-500Hz ~50-200Hz ~20-100Hz
Imagination horizon 15-50 steps (configurable) Limited by context window 3-10 steps (MPPI horizon)
Reward flexibility Fixed at training time Fixed at training time Changeable at deployment time
Open-source repo danijar/dreamerv3 (JAX) eloialonso/iris (PyTorch) nicklashansen/tdmpc2 (PyTorch)
License MIT MIT MIT

Cuándo usar cada uno

Elige Dreamer v3 Cuando:

  • Necesita un control continuo con horizontes de planificación largos. El RSSM del soñador puede imaginarse 15 a 50 pasos adelante sin un costo computacional prohibitivo, y el actor-crítico aprende a optimizar durante estos largos horizontes. Esto lo convierte en la mejor opción para tareas como la manipulación hábil, donde el robot debe planificar un enfoque de agarre, la colocación de los dedos y levantar como una secuencia coordinada.
  • Quieres un marco probado y bien documentado. Dreamer v3 se ha aplicado a más de 150 tareas y viene con un único conjunto de hiperparámetros que funciona de la caja para la mayoría de los dominios.
  • Tu espacio de acción es continuo. El soñador apoya las acciones continuas a través de su actor gaussiano.
  • Estás haciendo RL en línea en un robot real. La eficiencia de muestras del soñador (100-1000 veces mejor que los métodos sin modelos) significa que puedes aprender de las interacciones de robots reales en horas en lugar de semanas. Las actualizaciones de políticas basadas en la imaginación son libres de riesgos - solo la recopilación de datos interactúa con el mundo real.
  • Estás cómodo con JAX. La implementación de referencia está en JAX, que proporciona una excelente utilización de GPU pero tiene una curva de aprendizaje más pronunciada que PyTorch.

Seleccione IRIS Cuando:

  • Las acciones son naturalmente discretas o se pueden discretar. IRIS modelos todo como tokens, por lo que funciona mejor cuando el espacio de acción ya es discreto (gripper abierto/cerrado, comandos de navegación) o se puede integrar efectivamente en un número manejable de categorías.
  • Quiere aprovechar la escala de Transformer. Si tiene acceso a grandes computaciones y espera escalar su modelo mundial para manejar diversas tareas, la arquitectura de IRIS es la más adecuada para escalar.
  • Está interesado en los modelos del mundo generativo. Debido a que IRIS genera tokens de observación autoregresivamente, puede probar futuros posibles diversos para la misma secuencia de acción.
  • Su dominio de tareas ha sido validado. IRIS ha sido validado principalmente en Atari y tareas de control simples. Si su aplicación de robótica implica espacios de acción continuos y de alta dimensión (7-DOF arm + gripper), debe prototipar cuidadosamente y verificar que la discretization de acción no dificulta el rendimiento.

Seleccione TD-MPC2 Cuando:

  • Necesita funciones de recompensa flexibles en la implementación. Debido a que TD-MPC2 planea en línea utilizando el modelo mundial y una función de valor aprendido, puede modificar la función de recompensa en el tiempo de prueba sin necesidad de reentrenamiento. Especifique una nueva posición objetivo, agregue una penalización de colisión o cambie el objetivo de la tarea por completo - el planificador se adaptará. Esto es de un valor único para aplicaciones donde el objetivo se especifica en el tiempo de ejecución.
  • Quiere el entrenamiento más rápido. La arquitectura basada en MLP de TD-MPC2 se entrena 2-5 veces más rápido que Dreamer y 5-10 veces más rápido que IRIS. Para la creación de prototipos y la iteración rápidas, esta es una ventaja significativa.
  • Necesita un modelo único para muchas tareas. TD-MPC2 ha demostrado un modelo único que resuelve 104 tareas (variante del parámetro "317M"). Si su implementación implica muchas variaciones de tareas con el mismo robot, un modelo TD-MPC2 único de gran tamaño puede ser más práctico que entrenar modelos de Dreamer separados por tarea.
  • Su requisito de frecuencia de control es de 10-50Hz. El ciclo de planificación MPPI agrega latencia en comparación con un pase de política avanzada aprendido, pero para la mayoría de las tareas de manipulación (10-30Hz control), el tiempo de planificación de 10-50ms es aceptable.
  • Prefiere PyTorch. La implementación de referencia es PyTorch limpio con dependencias mínimas.

Integración con las estacas existentes

ROS2 Integración

Ninguno de los tres marcos de navegación con integración ROS2 nativa, pero envolverlos en un nodo ROS2 es sencillo. El patrón es el mismo para los tres:

Importar rclpy desde rclpy.node importar Nodo desde sensor_msgs.msg importar JointState, Imagen de std_msgs.msg importar Float64MultiArray clase WorldModelNode(Nodo): def __init__(self, world_model, planificador): super((__init_('world_model_node') self.model = world_model self.planner = planner # Subscribe a las observaciones self.create_subscriptionImage, '/camera/image_image', self.image_cb, 10) self.create_subscriptionJointState, '/action_joint_states', self.joint_cb, self.

Para TD-MPC2, el planificador es el algoritmo MPPI. Para Dreamer, es la red de actores aprendidos. Para IRIS, es un actor aprendido o una búsqueda en el espacio de acción tokenizado. La diferencia clave en la integración ROS2 es la latencia: el pase del actor del Dreamer hacia adelante se completa en ~1ms, mientras que el bucle MPPI de TD-MPC2 necesita 10-50ms, lo que afecta a cómo configuras el temporizador de control.

Integración de LeRobot

HuggingFace's [LeRobot framework]T1) se está convirtiendo en el estándar para experimentos de aprendizaje robótico. A partir de 2026, LeRobot apoya nativamente la clonación conductual y la política de difusión, pero no incluye entrenamiento de modelos mundiales. Sin embargo, el formato del conjunto de datos (episodios de Parquet con video sincronizado y estado) es compatible con los tres modelos mundiales con un adaptador ligero:

Desde lerobot.common.datasets.lerobot_dataset importar LeRobotDataset import numpy como np # Cargar un conjunto de datos LeRobot = LeRobotDataset("lerobot/pusht") # Convertir en episodios NPZ compatibles con Dreamer para el episodio_idx en el conjunto de datos.episode_data_stack["desde"": episodio = conjunto de datos.hf_dataset.filter(lamda x: x["episode_index"] ==\episode_idx) np.savez_compressedf"episodes/episode_{episode_idx}.nodepz", image=nodep.stack ]((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((

Para TD-MPC2, convertir a su formato HDF5 en su lugar. para IRIS, es necesario entrenar además el tokenizer VQ-VAE en las imágenes de observación antes de entrenar el modelo del mundo Transformer.

Gimnasio / Integración de MuJoCo

Los tres marcos soportan entornos de gimnasio (anteriormente OpenAI Gym) de forma nativa o con configuración mínima. Esto hace que sean fáciles de prototipar en simulación antes de pasar al hardware real:

  • Dreamer v3: Soporte integrado para DMControl, Atari, Minecraft y envs personalizados de gimnasio a través de un envase.
  • IRIS: Apoyo integrado de Atari. El control continuo del gimnasio requiere un envoltorio personalizado para la discretization de acción.
  • TD-MPC2: Soporte integrado para DMControl, Meta-World, Maniskill y MyoSuite. Para agregar nuevos entornos de gimnasio se requiere implementar un archivo de configuración de tareas (10-20 líneas).

Requisitos de datos por modelo

Tipo de trayectorias

Los tres modelos aprenden de los datos de trayectoria, pero son sensibles a propiedades diferentes:

  • Dreamer v3 necesita trayectorias con una estructura temporal clara. Se beneficia de episodios que incluyen tanto intentos exitosos como fallidos, ya que el predictor de recompensa necesita ejemplos negativos para calibrar.
  • IRIS necesita diversas trayectorias para entrenar un buen libro de códigos VQ-VAE. Si todos sus episodios se ven visualmente similares, el libro de códigos tendrá una mala cobertura de situaciones nuevas. Priorizar la diversidad visual: diferentes colores de objetos, posiciones, condiciones de iluminación y ángulos de cámara.
  • TD-MPC2 es el más flexible en cuanto a la calidad de los datos porque utiliza la planificación en línea en lugar de una política aprendida. Incluso con un modelo mundial algo inexacto, la planificación MPPI a menudo puede encontrar buenas acciones evaluando a muchos candidatos. Sin embargo, la función de valor (red Q) necesita una cobertura de datos suficiente para proporcionar estimaciones útiles del valor terminal.

Modalidad de observación

Modality Dreamer v3 IRIS TD-MPC2
RGB images Native (CNN encoder) Native (VQ-VAE) Supported (CNN encoder)
Proprioception only Supported (MLP encoder) Requires state tokenization Native (default modality)
Multi-camera Concatenate or multi-encoder Separate VQ-VAE per view Concatenate encodings
Point clouds Custom encoder needed Not well-supported Custom encoder needed
Force/torque Concatenate with proprioception Tokenize as additional modality Concatenate with proprioception

Duración del episodio

Los tres modelos manejan la longitud del episodio de manera diferente:

  • Dreamer v3: Trenes en subsecuencias de longitud fija (generalmente 50-64 pasos) muestran de episodios de cualquier longitud. Los episodios largos (1000+ pasos) están bien - el estado recurrente del RSSM mantiene el contexto. Esto hace que Dreamer sea adecuado para tareas de manipulación largas.
  • IRIS: Limitado por la ventana de contexto del Transformer. Con un contexto de 1024 tokens y 16 tokens por marco + 1 token de acción, obtienes aproximadamente 60 cuadros de contexto. Los episodios más largos requieren truncado o fragmentado, lo que puede perder dependencias de largo alcance.
  • TD-MPC2: Trenes en subsecuencias cortas (generalmente 5-10 pasos) porque el modelo dinámico es de paso único y la función Q maneja la asignación de créditos a largo plazo a través del aprendizaje TD. La longitud del episodio no afecta a la formación, pero el horizonte de planificación de MPPI es típicamente de solo 3-10 pasos, por lo que el planificador depende en gran medida de la función Q para las tareas de largo horizonte.

Código Quickstart

El soñador v3

# Instalar (JAX + GPU) pip instalar jax[cuda12] jaxlib dreamerv3 # Entrenamiento en DMControl Reacher python dreamerv3/main.py \ --configs dmc_vision \ --task dmc_reacher_easy \ --logdir ./logdir/reacher \ --steps 500000 # Entrenamiento en datos personalizados de robots (formato NPZ) python dreamerv3/main.py \ --configs dmc_vision \ --task_log_robot \ --logdir ./logdir/custom \ --data_dir /path/to/npz\episodes/ \ --steps 1000000

IRIS

# Instalar git clone T9 cd iris && pip instalar -e . # Train en Atari Breakout python src/main.py env.train.id=BreakoutNoFrameskip-v4 \ common.device=cuda:0 \ wandb.mode=offline # Configuración clave para dominios personalizados # config/trainer.yaml: # tokenizer.vocab_size: 512 # world_model.tokens_block: 17 # 16 obs tokens + 1 action token # world_model._blocks: 20 # context window in frames

TD-MPC2

# Instalar pip instalar tdmpc2 # Entrenamiento en DMControl Walker python train.py tarea=perro-run modelo_size=48 pasos=10000000 # Entrenamiento modelo único en 80 tareas DMControl python train.py tarea=mt80 modelo_size=317 pasos=25000000 lote_size=1024 # Evalúa con MPPI planificación python evaluate.py tarea=perro-run checkpoint=/path/to/model.pt \ num_samples=512 horizonte=5

Los modos de falla comunes y cómo deshacerse

El modelo mundial predice el futuro

Sintoma: Las observaciones imaginarias decodificadas parecen un promedio de múltiples resultados plausibles.

** Diagnóstico:** El espacio latente del modelo no capta la multimodlidad. común con las variables latente gaussianas (Dreamer v1/v2) o los libros de código VQ-VAE de bajo tamaño (IRIS).

Fix: Para Dreamer, asegúrese de que está utilizando los latences categóricos discretos de v3, no Gaussian. Para IRIS, aumente el tamaño del libro de código VQ-VAE (intente 1024 o 2048) y los tokens por marco (32 o 64). Para TD-MPC2, esto es menos de un problema porque el espacio latente es condicionado a tareas y no necesita reconstruir observaciones.

La política aprovecha las inexactitudes del modelo mundial

Síntoma: La política logra una recompensa imaginada alta pero falla en el robot real. Ha encontrado un "erroreo" en el modelo mundial - una secuencia de acción de estado que recibe una recompensa alta predicha pero no corresponde a la física real.

Diagnosis: La política se ha movido a una región de espacio de acción estatal donde el modelo mundial es inexacto, y está explotando esas inexactitudes.

Fix: (1) Entrenar un conjunto de 3-5 modelos mundiales y penalizar la política para visitar estados donde las predicciones del conjunto no coinciden. (2) Acortar el horizonte de la imaginación para reducir el error de composición. (3) Recopilar más datos reales en las regiones donde la política opera y retarretar el modelo mundial. Para TD-MPC2, el horizonte de planificación de MPPI es ya corto (3-10 pasos), lo que hace que esto sea menos común.

El código de VQ-VAE se descompone

Sintoma: Sólo se utiliza una pequeña fracción de las entradas del libro de códigos.

Diagnosis: El entrenamiento de VQ-VAE se desplomó para utilizar un subconjunto de códigos.

Fix: (1) Utilice actualizaciones de código de promedio móvil exponencial (EMA) en lugar de basadas en gradientes. (2) Aumente el tamaño del libro de código. (3) Agregue el reset del libro de código: reinicie periódicamente los códigos no utilizados de la distribución de salida del codificador. (4) Utilice un peso de pérdida de compromiso de 0,25 (el valor predeterminado en IRIS).

Inestabilidad de aprendizaje TD (TD-MPC2)

Síntomas: Los valores Q divergen o oscilan durante el entrenamiento.

Diagnosis: El aprendizaje de diferencias temporales para la función de valor es inestable, a menudo debido a una tasa de aprendizaje demasiado alta o a una frecuencia de actualización insuficiente de la red objetivo.

Fix: (1) Reducir la tasa de aprendizaje de la función Q (intentar 3e-4 en lugar de 1e-3). (2) Aumentar el coeficiente de actualización suave de la red objetivo tau (de 0.01 a 0.005 para actualizaciones más suaves). (3) Agregar normalización de capas a la red Q. Los hiperparámetros predeterminados de TD-MPC2 son generalmente estables, por lo que si los está modificando, vuelva a los valores predeterminados primero.

Diversidad de datos insuficiente

Sintoma: El modelo mundial hace predicciones precisas sobre estados similares a los de entrenamiento, pero fracasa catastróficamente en configuraciones iniciales ligeramente diferentes.

Diagnosis: El conjunto de datos carece de variación suficiente en los estados iniciales, configuraciones de objetos o condiciones ambientales.

Fix: Este es un problema de datos, no un problema de modelo. Recoge más episodios con condiciones iniciales aleatorias deliberadamente. [servicio de recopilación de datos] T2) de RCSV sigue protocolos de aleatorización estructurados diseñados específicamente para maximizar la cobertura del espacio-estado para el entrenamiento de modelos mundiales.

Lectura relacionada

  • [Modelos mundiales para la robótica: por qué importan]
  • [Empezando con los modelos mundiales] T4) - Tutorial práctico paso a paso
  • [Política de difusión para el aprendizaje de robots]T5) -- Arquitectura complementaria de las políticas
  • Guía marco de LeRobot -- Formatos de conjunto de datos compatibles con modelos mundiales
  • [¿Qué es los datos de formación de robots?]
  • Servicios de datos del RCSV -- Datos de trayectoria para la formación de modelos mundiales