Volver a Blog

Los modelos mundiales de robótica: por qué son importantes y cómo funcionan

¿Qué son los modelos mundiales para la robótica? Aprenda cómo los modelos de dinámica aprendidos como Dreamer, IRIS y TD-MPC2 permiten el aprendizaje de robots eficientes mediante la planificación basada en la imaginación, la transferencia sim-a-realidad y la validación de seguridad.

Por Jerry Huang · 22 de abril de 2026

Los modelos mundiales son modelos de dinámica aprendidos que predicen futuros estados a partir de acciones, permitiendo a los robots planificar, explorar y validar el comportamiento en la imaginación antes de ejecutarlo en el mundo real. Se están convirtiendo rápidamente en la pieza central en la pila de aprendizaje de los robots, cerrando la brecha entre la eficiencia de la muestra de los métodos basados en modelos y la expresividad del aprendizaje profundo. Este artículo explica qué son, cómo difieren las principales arquitecturas y cómo decidir si su proyecto necesita una.

¿Qué son los modelos mundiales?

Un modelo mundial es una red neuronal que aprende la dinámica de un entorno a partir de datos. Dado un estado actual (o observación) y una acción, el modelo predice el siguiente estado, la recompensa y opcionalmente si el episodio ha terminado. Esta no es una idea nueva, el aprendizaje de refuerzo basado en modelos ha existido durante décadas, pero la combinación de aprendizaje profundo, datos a gran escala y modelado de secuencias moderno ha hecho que los modelos mundiales sean dramáticamente más capaces desde 2020.

Formalmente, un modelo mundial se aproxima a la función de transición T s, r s, a) de un proceso de decisión de Markov. En la práctica, la mayoría de los modelos mundiales modernos operan en un espacio latente aprendido en lugar de directamente en observaciones crudas. El modelo consiste en tres componentes:

  • Encodificador: Mapas de observaciones crudas (imágenes, propriocepción, nubes de puntos) en una representación latente compacta z_t.
  • Modelo de dinámica: Predece el siguiente estado latente z_{t+1} dado el estado latente actual z_t y la acción a_t. Este es el núcleo del modelo mundial.
  • Decodificadores(s): Reconstruir observaciones, predecir recompensas y predecir el final de episodios desde estados latentes. Estos proporcionan la señal de entrenamiento y permiten la evaluación de las trayectorias imaginadas.

La propiedad clave que hace que los modelos mundiales sean útiles es que una vez entrenados, el modelo dinámico puede ser "desarrollado" en la imaginación, se pueden simular miles de trayectorias sin tocar nunca al robot real. Esto es lo que permite la planificación, optimización de políticas y validación de seguridad completamente dentro del modelo aprendido.

Por qué la robótica necesita modelos mundiales

Los métodos de aprendizaje de refuerzo (RL) sin modelos como PPO y SAC aprenden por prueba y error, requiriendo que millones de interacciones ambientales convergen. En la simulación, esto es meramente costoso. En el hardware real, es poco práctico y peligroso - un brazo robótico que explora al azar chocará con objetos, dañará los efectos finales y perderá semanas de tiempo en un reloj de pared. Los modelos mundiales abordan este cuello de botella fundamental a través de cuatro mecanismos:

1. Eficiencia de muestras

Los modelos mundiales extraen más señales de aprendizaje de cada interacción en el mundo real. En lugar de usar una transición (s, a, r, s') una vez para actualizar una función de valor, el modelo mundial las almacena como datos de entrenamiento. Una vez que el modelo es lo suficientemente preciso, el agente puede generar una experiencia sintética ilimitada mediante el rollo de la modelo. Dreamer v3, por ejemplo, aprende juegos Atari de 200K marcos de entorno donde los métodos libres de modelos necesitan 50-200M marcos - una mejora de 100-1000 veces en la eficiencia de la muestra. Para la robótica, donde cada marco cuesta tiempo real y el desgaste real del hardware, esta diferencia es existencial.

2. Planificación y Vigilante

Con un modelo de mundo preciso, un robot puede evaluar las secuencias de acción candidata antes de comprometerse con una. El control predictivo de modelo (MPC) con un modelo de dinámica aprendida funciona: (1) proponiendo N secuencias de acción candidata, (2) lanzando cada una a través del modelo mundial, (3) anotando cada trayectoria por recompensa acumulada predicha, y (4) ejecutando la primera acción desde la mejor trayectoria. Este ciclo de planificación se repite en cada paso de control, dando al robot una forma de razonamiento deliberativo que las políticas reactivas carecen.

3. Validación de seguridad

Antes de implementar una política en un robot real, puedes implementarla en el modelo mundial para comprobar si hay estados peligrosos - colisiones, violaciones de límites articulares, fuerzas excesivas o violaciones de límites del espacio de trabajo. Esto es más rápido y más barato que la simulación física porque el modelo mundial funciona en GPU como un solo paso hacia adelante por paso, sin la carga de los solventes de dinámica de contacto. También es más realista que la simulación sintonizada a mano porque el modelo mundial ha aprendido de datos reales y captura fenómenos (dinámica de cables, deformación de objetos suaves, ruido de sensores) que son difíciles de simular analíticamente.

4. Transferencia de Sim a Real

Los modelos mundiales entrenados en datos reales de robots sirven como simuladores aprendidos que coinciden inherentemente con la dinámica real. La brecha entre sim y realidad - la falta de coincidencia entre la simulación física y la realidad - es el modo de fracaso dominante en las políticas de robots entrenados en simulación. Un modelo de mundo entrenado en una modesta cantidad de datos reales (1-10 horas de interacción) puede capturar dinámicas que son notoriamente difíciles de simular: enrutamiento de cables, manipulación de objetos deformables, fricción en superficies variadas y contacto conforme.

Arquitecturas clave

El panorama mundial de modelos ha evolucionado rápidamente. Aquí están las arquitecturas que más importan para los profesionales de la robótica.

El soñador (v1, v2, v3) -- Hafner et al., 2020-2023

Dreamer es el marco de modelo mundial más maduro y ampliamente utilizado. Aprende un Modelo Espacial de Estado Recurrente (RSSM) que mantiene tanto un estado recurrente determinista (captura de historia) como un estado latente estocástico (captura de incertidumbre). El agente aprende una política de actores críticos enteramente dentro de las trayectorias imaginadas del modelo mundial, nunca necesitando hacer RL en el entorno real después de la fase inicial de recopilación de datos.

Dreamer v3 (2023) introdujo varias mejoras clave: predicciones de símbolo para la recompensa y la normalización de valor en tareas con escalas de recompensa muy diferentes, representaciones latentes discretas (32 variables categóricas con 32 clases cada una = código discreto de 1024 dimensiones), y un conjunto unificado de hiperparámetros que trabaja en más de 150 tareas sin ajuste. Es el primer agente de modelos del mundo en recoger diamantes en Minecraft desde cero, una tarea que requiere cientos de decisiones secuenciales en diversos estados del juego.

Para la robótica, Dreamer v3 es el punto de partida predeterminado. Maneja el control continuo de manera natural, se entrena en presupuestos modestos de GPU (RTX 3090), y se ha aplicado con éxito a manipulación real de robots, locomoción y tareas de navegación. Su limitación principal es el error de composición de horizonte largo: para tareas que requieren más de 200 pasos de predicción precisa, las trayectorias imaginadas se desvían de la realidad.

IRIS -- Micheli et al., 2023

IRIS (Imagination with auto-Regression over an Inner Speech) adopta un enfoque radicalmente diferente: tokeniza tanto las observaciones como las acciones en tokens discretos utilizando un VQ-VAE, luego modela la secuencia conjunta con un Transformer autoregresista. El modelo mundial es esencialmente un predictor de tokens próximos de estilo GPT sobre tokens de observación y acción intercalados.

Esta arquitectura tiene una ventaja profunda: hereda las propiedades de escala de los modelos de lenguaje grande. A medida que aumenta el tamaño del modelo y los datos, la calidad de predicción mejora predeciblemente. IRIS logró rendimiento sobrehumano en 10 de los 26 juegos Atari utilizando solo 100K interacciones ambientales - comparable a Dreamer v3 pero con una arquitectura que es más susceptible de escala.

La compensación es que la tokenización a través de VQ-VAE introduce compresión de pérdidas. La información espacial de granos finos que es importante para la manipulación precisa (la posición exacta de una cabeza de tornillo, la orientación de un conector) se puede perder en el cuello de botella discreto. Para las tareas de robótica que requieren precisión sub-milimétrica, esto es una preocupación real. Para la navegación, la locomoción y la manipulación gruesa, la representación tokenizada es suficiente y las propiedades de escala son atractivas.

TD-MPC2 -- Hansen et al., 2024

TD-MPC2 (Temporal Difference Learning for Control Predictivo de Modelos, versión 2) combina un modelo de dinámica latente aprendido con un control modelo-predictivo en el momento de la inferencia. A diferencia de Dreamer, que entrena a un actor-crítico separado en la imaginación, TD-MPC2 utiliza el modelo mundial directamente para la planificación en línea a través del algoritmo Integral de Trayectoria Predictiva de Modelos (MPPI). En cada paso de control, muestra secuencias de acción, las presenta a través del modelo dinámico, las califica utilizando una función de valor aprendida y ejecuta la mejor primera acción.

TD-MPC2 contribuye a la demostración de que un solo conjunto de hiperparámetros y una única arquitectura de modelo pueden resolver 104 tareas de control continuo que abarcan la locomoción, la manipulación y la navegación. Esta sencillez hace que sea rápido entrenar y rápido inferir.

Para la robótica, TD-MPC2 es convincente cuando se quiere que el modelo mundial dirija directamente el control a través de la planificación en lugar de destilarlo en una política separada. Esto lo hace adecuado para tareas donde el objetivo cambia en el momento de su despliegue: diferentes posiciones de objetivo, diferentes requisitos de comprensión o objetivos específicos por el hombre.

UniSim -- Yang et al., 2024

UniSim es un "simulador universal" que genera un video realista de futuras observaciones condicionadas a las acciones. La idea clave es que los datos de vídeo a escala de Internet contienen física implícita -- objetos caen, flujos fluyen, puertas se balancean -- y un modelo generativo suficientemente grande puede aprender estas dinámicas sin supervisión física explícita.

UniSim opera en el espacio de píxeles en lugar de en el espacio latente, lo que significa que puede hacer fotorrealistas futuros marcos que son directamente interpretables. Esto es útil para la inspección humana de las trayectorias planificadas y para la formación de políticas basadas en visión descendente. Sin embargo, la generación de espacios de píxeles es computacionalmente costosa: generar un despliegue de 16 cuadros a 256x256 toma ~ 2 segundos en un A100, lo que lo hace demasiado lento para la planificación en tiempo real de estilo MPC.

El papel de UniSim en la pila de robótica es como una herramienta de aumento de datos y evaluación de políticas en lugar de un planificador en tiempo real. Puede utilizarlo para generar episodios de entrenamiento sintéticos, visualizar lo que haría una política en situaciones nuevas o evaluar la seguridad antes de su implementación. No es un reemplazo para Dreamer o TD-MPC2 como una columna vertebral de planificación.

Genie / Genie 2 - Bruce et al., 2024

Genie (Environments Interactivos Generativos) es un modelo de mundo de base de Google DeepMind entrenado en video a escala de Internet. Genie 2 lo extiende a entornos 3D, generando simulaciones de mundo coherentes y controlables a partir de una sola imagen. A diferencia de los modelos mundiales específicos de tareas, Genie está diseñado como un generador de entornos de propósito general que se puede ajustar a dominios específicos.

Para la robótica, el significado de Genie es como un modelo de fundación pre-entrenado. En lugar de entrenar un modelo del mundo desde cero en sus datos robóticos (que requiere 10-100 horas más de interacción), podría ajustar a Genie en una pequeña cantidad de datos específicos de dominio y aprovechar su conocimiento previo de la física y las relaciones espaciales. Este paradigma - modelo mundial de fundación + ajuste del dominio - refleja el éxito de los modelos de lenguaje de fundación y es probablemente la dirección en la que el campo se mueve en 2026-2027.

Modelos de mundo de espacio latente vs. mundo de espacio píxeles

Esta es la decisión arquitectónica más importante al construir o elegir un modelo mundial.

Property Latent-Space (Dreamer, TD-MPC2) Pixel-Space (UniSim, Genie)
Rollout speed ~0.1ms per step (GPU) ~50-200ms per step
Planning compatibility Real-time MPC feasible Offline planning only
Human interpretability Low (latent vectors are opaque) High (viewable video frames)
Spatial precision Task-dependent (can be high) Limited by generation resolution
Training compute Single GPU (hours-days) Multi-GPU cluster (days-weeks)
Data efficiency Good (100K-1M frames) Poor (needs millions of frames or pre-training)
Generalización Narrow (domain-specific) Broad (foundation models generalize across domains)
Best use case Real-time control + online RL Data augmentation + offline evaluation

** Recomendación práctica:** Para la mayoría de los proyectos de robótica en 2026, utilice un modelo del mundo del espacio latente (Dreamer v3 o TD-MPC2) como su modelo de dinámica principal. Si necesita implementaciones inspectables por humanos para la revisión de la seguridad o la comunicación con las partes interesadas, agregue un decodificador del espacio de píxeles que haga que las trayectorias latentes se conviertan en video a pedido. Esto le da la velocidad de la planificación del espacio latente con la interpretabilidad de la visualización del espacio-pixel cuando lo necesite.

Requisitos de datos de formación

Los modelos mundiales son tan buenos como los datos en los que se entrenan. Este es el factor más importante en el rendimiento del modelo mundial, y el más subestimado por los equipos nuevos en el campo.

¿Qué tipo de datos?

Los modelos mundiales necesitan tuples de transición: (observación, acción, recompensa, observación, hecho).

  • ** Imágenes RGB** de una o más cámaras (montadas en la muñeca, por encima o ambas).
  • Estado propioceptivo: posiciones articulares, velocidades, estado de agarre, pose de efecto final. Siempre incluye esto - proporciona información precisa del estado que complementa las observaciones visuales ruidosas.
  • Acciones: los comandos enviados al robot en cada paso de tiempo. Para las armas, este es típicamente el comando de velocidad conjunta o delta del efecto final.
  • Premios (opcional para la formación fuera de línea): señales de finalización de tareas, distancias de meta o escasos indicadores de éxito.

Cuánto datos

Los requisitos de datos varían según la arquitectura y la complejidad de las tareas:

  • Dreamer v3: 50-200 episodios (10K-50K transiciones) para la manipulación de tareas individuales. 500-2000 episodios para tareas multitarea o complejas ricas en contactos.
  • TD-MPC2: Similar a Dreamer para la manipulación. Puede comenzar a planificar eficazmente con tan pocos como 20-50 episodios para tareas de alcance simple, pero las tareas complejas necesitan 200+.
  • IRIS: Más hambriento de datos debido a la formación de tokenizadores VQ-VAE. Presupuesto 2-3 veces lo que Dreamer necesita para un rendimiento equivalente.
  • UniSim/Genie: Requiere una formación previa en datos a escala de Internet.

La calidad es más importante que la cantidad

Los datos de baja calidad perjudican activamente la formación de modelos mundiales.

  • Frecuencia de control incoherente: Si la recopilación de datos se ejecuta a velocidades variables (a veces 10Hz, a veces 30Hz), el modelo dinámico aprende una relación de tiempo incoherente.
  • ** Desalineamiento de la acción del estado:** Si las marcas de tiempo de observación y las marcas de tiempo de acción no se sincronizan adecuadamente, el modelo aprende dinámicas incorrectas.
  • Cobreza insuficiente de los estados: Un conjunto de datos de 1000 episodios que comienzan todos desde la misma configuración inicial vale menos de 200 episodios con diversos estados iniciales.
  • Episódios corruptos: Episódios en los que la tarea falló debido a problemas de hardware (drift de codificación, caídas de comunicación, mal funcionamiento del sujetador) enseñan a la dinámica del modelo mundial incorrecta.

Las limitaciones actuales

Los modelos mundiales son poderosos, pero no son un problema resuelto.

Compañando errores

Cada predicción del modelo mundial tiene algún error. Cuando se desarrolla el modelo para 100 pasos, estos errores se componen - cada predicción se basa en la predicción anterior, no en la verdad de la tierra. Para el paso 200, la trayectoria imaginada puede tener poco parecido a lo que realmente ocurriría. Esto limita el horizonte de planificación efectivo a aproximadamente 20-50 pasos para los modelos actuales (2-5 segundos en el control de 10Hz). Las tareas que requieren horizontes de planificación más largos requieren enfoques jerárquicos o un reancramiento periódico a las observaciones reales.

Cambios de distribución

El modelo mundial es preciso sólo en regiones de espacio de acción del estado que ha visto durante el entrenamiento. Si su política explora estados que el modelo mundial nunca ha encontrado - una configuración de objeto novedosa, un estado de colisión inusual, o una condición de iluminación diferente - las predicciones del modelo se vuelven poco confiables. Peor aún, la política puede aprender a explotar las inexactitudes en el modelo mundial, encontrando trayectorias "imaginarias" de alto beneficio que no se transfieren a la realidad. La estimación de incertidumbre basada en el conjunto (entrenando múltiples modelos mundiales y midiendo el desacuerdo de predicción) mitigará parcialmente esto marcando predicciones inciertas.

La fidelidad a largo plazo

Incluso dentro de la distribución, los modelos mundiales luchan con largas secuencias de interacciones ricas en contactos. Los modelos mundiales actuales pueden manejar secuencias cortas de contacto (agarrar, empujar, insertar) pero degradarse en tareas de montaje en múltiples etapas extendidas.

Computa el costo de la planificación en línea

La planificación en estilo MPC con un modelo mundial requiere el despliegue de cientos de trayectorias candidatas en cada paso de control. Para TD-MPC2 con MPPI, esto significa 512 despliegues x 5 pasos = 2560 pasos del modelo dinámico hacia adelante por paso de control. En un RTX 4090, esto funciona a ~ 15Hz, lo que es adecuado para muchas tareas de manipulación pero insuficiente para el control de la locomoción de alta frecuencia. La planificación amortizada (destillación del planificador en una política reactiva) puede alcanzar 100 Hz + pero requiere formación adicional.

Cómo los modelos mundiales complementan las políticas de VLA y difusión

Los modelos mundiales no son un reemplazo para los modelos de visión-lenguaje-acción (VLA) o políticas de difusión.

Modelo mundial + VLA: Un VLA como RT-2 o Octo genera acciones a partir de observaciones visuales e instrucciones de lenguaje. Un modelo mundial puede servir como verificador - antes de que el robot ejecute la acción propuesta por el VLA, el modelo mundial simula el resultado y verifica las violaciones de seguridad. Si el resultado previsto es peligroso (colisión, fuerza excesiva), el sistema puede rechazar la acción y solicitar una alternativa. Esto es análogo a cómo un motor de ajedrez utiliza un modelo mundial (las reglas del juego) para evaluar los movimientos del candidato antes de seleccionar uno.

Modelo mundial + Política de difusión: La política de difusión genera diversas trayectorias de acción mediante muestreo de una distribución aprendida. Un modelo mundial puede calificar a estos candidatos por la calidad del resultado predicho, seleccionando la trayectoria más probable de tener éxito. Esto combina la expresividad multimodal de la política de difusión con la evaluación prospectiva de un modelo mundial. En la práctica, esto significa ejecutar el proceso de denuncia de la Política de Difusión para generar trayectorias de 8 a 16 candidatos, rodando cada una a través del modelo mundial y ejecutando la que tiene la mayor recompensa prevista.

Modelo mundial para el aumento de datos: Tal vez el uso más práctico a corto plazo: entrenar un modelo mundial en sus datos recopilados, luego usarlo para generar episodios de entrenamiento sintéticos para un VLA o Política de difusión en aguas al mar. Esto puede 3-10 veces el tamaño efectivo de su conjunto de datos a costa de computación de GPU en lugar de recopilación de datos adicionales. Los datos sintéticos deben mezclarse con datos reales (generalmente 50-80% sintéticos, 20-50% reales) para mantener la base.

Comparación práctica: Dreamer v3 vs IRIS vs TD-MPC2 vs UniSim

Property Dreamer v3 IRIS TD-MPC2 UniSim
Architecture RSSM (GRU + stochastic latent) VQ-VAE + autoregressive Transformer MLP encoder + MLP dynamics Video diffusion (U-Net or DiT)
Parameters ~20M (S), ~100M (L), ~200M (XL) ~80M (base), ~300M (large) ~5M (S), ~19M (M), ~317M (L) ~1-3B
Data needs (single task) 50-200 episodes 200-500 episodes 50-200 episodes Pre-trained + 50-500 fine-tune episodes
Training GPU 1x RTX 3090 (6-24h) 1x RTX 3090 (12-48h) 1x RTX 3090 (2-12h) 8x A100 (days-weeks)
Inference speed ~50us/step (imagination) ~1ms/token ~0.1ms/step (latent rollout) ~100-200ms/frame
Primary task domains Manipulación, locomotion, games Atari, discrete-action domains Continuous control (manipulation, locomotion) Navigation, manipulation (visual)
Key strength Universal hyperparameters, robust Scaling properties, discrete tokens Fast training, flexible reward Photorealistic, broad generalization
Open-source Yes (danijar/dreamerv3) Yes (eloialonso/iris) Yes (nicklashansen/tdmpc2) No (research preview only)

Conexión con el RCSV: recopilación de datos para la formación mundial de modelos

La construcción de un buen modelo mundial comienza con buenos datos. Los servicios de recopilación de datos de RCSV están diseñados para producir el tipo de datos de trayectoria sincronizados de alta calidad, diversos y que los modelos mundiales necesitan. Nuestra línea de recogida garantiza la grabación de frecuencia fija (50Hz), la alineación de la acción de estado marcada por hardware y la variación estructurada entre los episodios (posiciones aleatorias de objetos, estrategias de enfoque variadas, configuraciones iniciales diversas).

Para los equipos que entrenan modelos del mundo, ofrecemos conjuntos de datos en formatos compatibles con Dreamer v3 (episodios de NPZ), TD-MPC2 (HDF5) y el ecosistema HuggingFace LeRobot (Parquet + video).

El modelo mundial de pre-entrenamiento se beneficia particularmente de la diversidad de datos -- episodios que abarcan muchos escenarios, objetos y estrategias de manipulación diferentes. Nuestros [ensambles de datos públicos] T1) incluyen episodios de manipulación en más de 50 categorías de objetos que pueden servir como datos de pre-entrenamiento antes de ajustar su tarea específica. Para las campañas de recopilación de datos personalizadas centradas en la capacitación de modelos mundiales, [contacte a nuestro equipo]T2) para discutir sus requisitos.

Lectura relacionada

  • Dreamer vs IRIS vs TD-MPC2 -- Comparación detallada para elegir un modelo mundial
  • [Empezando con Modelos Mundiales] T4) -- Tutorial práctico con código
  • [Política de difusión para el aprendizaje de robots] T5) -- Cómo las políticas de difusión complementan los modelos mundiales
  • Modelos de VLA explicados -- Modelos de visión-lenguaje-acción e integración de modelos mundiales
  • [¿Qué es los datos de formación de robots?]
  • Servicios de datos del RCSV -- Datos de trayectoria para la formación de modelos mundiales
  • Conjunto de datos públicos -- Conjunto de datos de manipulación listo para su uso