Transfertado de Sim a Realidad Explicado: La brecha de realidad, la adaptación de dominio y el camino hacia adelante
Una inmersión profunda en la transferencia de simulación a la realidad para la robótica: la brecha de realidad, los niveles de fidelidad de la simulación, los métodos de adaptación de dominio, la historia de los avances y hacia dónde se dirige el campo en 2026.
Entrenar robots en simulación y implementarlos en hardware real es una de las ideas más atractivas de la robótica: datos ilimitados, desgaste de hardware cero, entrenamiento paralelo en miles de instancias. Pero la brecha entre simulación y realidad tiene profundas raíces, y cerrarla ha requerido décadas de progreso en motores de física, renderización, aprendizaje automático e identificación de sistemas. Este artículo traza la historia, explica la teoría y mapea el estado del arte.
La brecha entre la realidad: por qué la simulación no es realidad
Cada simulador de física hace aproximaciones. La dinámica rígida del cuerpo se modela con integradores de tiempo discreto que introducen errores numéricos. Las fuerzas de contacto se calculan utilizando métodos de penalización o solventes de restricciones que producen artefactos - penetración, nerviosismo, restitución irrealista - que no tienen contraparte en el mundo real. Las propiedades del material (fritación, rigidez, amortiguación) se especifican como parámetros escalares que simplifican fenómenos físicos complejos, no lineales y dependientes del estado.
En el lado visual, las imágenes renderizadas difieren de las imágenes reales de la cámara de maneras que a menudo son invisibles para los humanos pero significativas para las redes neuronales. Las sombras rastreadas por rayos carecen de la oclusión ambiental sutil de los entornos reales. La reflexión material se aproxima por modelos BRDF que no pueden capturar la complejidad completa de las superficies reales. Los modelos de ruido de las cámaras no coinciden perfectamente con las características de ruido de los sensores reales. Estas discrepancias visuales son especialmente problemáticas para las políticas que utilizan características visuales aprendidas, porque las características son sensibles a las propiedades de distribución exactas que la representación se equivoca.
El efecto composto de estas aproximaciones individuales crea la brecha de realidad: una política que alcanza una tasa de éxito del 95% en la simulación puede caer al 20% en el hardware real. La brecha no es una sola cosa - es el efecto acumulado de docenas de pequeñas discrepancias en la dinámica, la detección y el control.
Una breve historia de la investigación sim-to-real
La transferencia de simulación a realidad ha sido un tema de investigación desde los primeros días del aprendizaje de robots. En los años noventa y dos mil, equipos de la Universidad del Sur de California y el Centro Aeroespacial Alemán demostraron la transferencia de políticas simples de alcance y captura de la simulación a robots reales, pero los resultados se limitaron a tareas en las que el modelado físico preciso no era crítico.
El campo dio un gran paso adelante en 2017 cuando OpenAI demostró la aleatorización de dominios para una tarea de manipulación robótica hábil - entrenando una política para reorientar un bloque usando una Mano Sombra completamente en simulación y desplegándolo en hardware real. La innovación clave fue la aleatorización de parámetros de simulación (fritación, masa, ganancias del actuador, apariencia visual) en un rango tan amplio que el mundo real se convirtió en una muestra más de la distribución de entrenamiento. Este trabajo, publicado como "Randomization de dominio para transferir redes neuronales profundas de la simulación al mundo real" por Tobin et al., estableció la randomization de dominio como el enfoque predeterminado para los próximos años.
En 2019, OpenAI extendió este enfoque a la tarea más compleja de resolver un cubo de Rubik con una mano destreza - una de las demostraciones más citadas de transferencia sim-a-real. La capacitación utilizó miles de millones de pasos de simulación con extensa aleatorización de dominios, aleatorización automática de dominios (ADR) que amplió progresivamente los rangos de aleatorización durante la capacitación y una arquitectura maestro-estudiante utilizando información privilegiada.
Desde 2020 hasta 2024, la comunidad de robótica de piernas logró el éxito práctico más consistente con la transferencia de sim a real. Grupos en ETH Zurich (ANYmal), MIT, Carnegie Mellon y compañías comerciales como Unitree y Agility Robotics demostraron políticas entrenadas enteramente en simulación que realizaron una locomoción robusta en cuádrupedos reales y bipedos en diversos terrenos. Estos éxitos se basaron en la formación privilegiada de información, la identificación cuidadosa del sistema y el hecho de que la dinámica de la locomoción está bien modelada por simuladores de cuerpos rígidos estándar.
Niveles de fidelidad de la simulación
La fidelidad de la simulación existe en un espectro, y entender dónde cae su simulador es esencial para predecir lo difícil que será la transferencia:
Las simulaciones de baja fidelidad utilizan dinámicas simplificadas (modelos de masa de punto, modelos solo cinemáticos) y renderización básica (colores sólidos, sin sombras). Estos son útiles para el desarrollo y la prueba de algoritmos, pero rara vez producen políticas transferibles. Ejemplos: entornos simples OpenAI Gym, configuraciones básicas PyBullet sin parámetros ajustados.
Las simulaciones de fidelidad media utilizan una dinámica rígida del cuerpo precisa con parámetros de contacto ajustados y renderización razonable (pero no fotorrealista). Aquí es donde se produce la transferencia más exitosa de sim a realidad. La dinámica es lo suficientemente buena como para que la aleatorización de dominio pueda cerrar la brecha restante. Ejemplos: entornos MuJoCo bien configurados con parámetros identificados por el sistema, entornos Genesis con física calibrada.
Las simulaciones de alta fidelidad tienen como objetivo lograr una brecha mínima entre el sim y el real a través de un modelo físico preciso, una representación fotorrealista y una simulación detallada de sensores. El objetivo es hacer que la simulación sea tan precisa que la brecha sea lo suficientemente pequeña como para cruzarla sin la aleatorización de dominios. Ejemplos: NVIDIA Isaac Sim con activos calibrados, simuladores personalizados con modelos de contacto validados. La simulación de alta fidelidad reduce la necesidad de la aleatorización de dominios, pero requiere una inversión de ingeniería significativa en la creación de activos y la calibración física.
En la práctica, la simulación de fidelidad media con la aleatorización de dominios es el enfoque con el mejor compromiso de costos y rendimiento para la mayoría de las tareas. La simulación de alta fidelidad se justifica cuando la tarea es demasiado sensible para que la aleatorización de dominios pueda cerrar la brecha (ensamblaje de precisión) o cuando se necesitan políticas visuales fotorealizadas.
Métodos de adaptación de dominio
Randomization de dominio (DR) sigue siendo el enfoque dominante. La idea principal: si el mundo real se encuentra dentro de la distribución de la randomization, la política debe ser robusta para las condiciones del mundo real. Su limitación es que la aleatorización muy amplia hace que el problema de aprendizaje sea más difícil y puede reducir el máximo rendimiento. La política debe ser robusta a condiciones que nunca encontrará, lo que limita su capacidad para explotar las condiciones específicas que encuentra.
La identificación del sistema (SysID) adopta el enfoque opuesto: en lugar de aleatorizar los parámetros, medirlos con precisión y ajustar la simulación a la realidad. La limitación es que la identificación perfecta del sistema es poco práctica, algunos parámetros son difíciles o imposibles de medir, y las condiciones del mundo real cambian con el tiempo. En la práctica, SysID se utiliza para establecer el centro de una distribución de aleatorización de dominio en lugar de como una técnica independiente.
La adaptación de dominio utiliza el aprendizaje automático para transformar las observaciones de simulación para que parezcan observaciones reales (o viceversa), generalmente utilizando redes adversarias generativas (GAN) o autoencodadores variacionales (VAE). La adaptación visual sim-to-real basada en CycleGAN ha mostrado resultados prometedores para tareas donde la brecha visual es la principal barrera. La limitación es que la adaptación de dominio añade complejidad al modelo y puede introducir artefactos.
El ajuste fino de simulación de simulación a real forma la mayor parte de la política en la simulación y luego se ajusta a una pequeña cantidad de datos reales. Esto combina la eficiencia de los datos de la simulación con la fidelidad de la interacción en el mundo real. El ajuste fino con 50-200 demostraciones reales después de la simulación de la formación previa a menudo supera tanto la formación solo en simulación como la formación solo en realidad.
**Información privilegiada (maestro-alumno) ** capacita a una política de profesor con acceso al estado de simulación de la verdad de fondo, luego destiliza su comportamiento en un estudiante que utiliza solo las observaciones disponibles en hardware real. Esto proporciona una señal de entrenamiento más fuerte que la recompensa sola y se ha convertido en el enfoque estándar para la transferencia de locomoción. Su eficacia para la manipulación está creciendo a medida que surgen mejores técnicas de destilación.
La aleatorización de dominios en la práctica: qué hacer aleatoriamente
La aleatorización de dominios es simple en concepto, pero requiere que se elijan cuidadosamente qué parámetros aleatorizar y en qué rango.
Alrededor de la superficie
| Parameter | Randomization Range | Impact on Transfer |
|---|---|---|
| Object textures and colors | Random RGB values, random textures from ImageNet crops | High — prevents color-based overfitting |
| Lighting direction and intensity | 1-4 point lights, random position on hemisphere, 0.3-3.0x intensity | High — shadow patterns differ between sim and real |
| Camera position perturbation | +/- 2cm translation, +/- 3 degrees rotation | Medium — handles calibration error |
| Background texture | Random crops from texture datasets | Medium — table and background appearance varies |
| Camera noise model | Gaussian noise sigma 0-10, random cutout patches | Low-Medium — real cameras are noisy |
Al azar físico
| Parameter | Typical Range | Critical For |
|---|---|---|
| Object mass | 0.5x-2.0x nominal | Grasping force, lifting dynamics |
| Friction coefficient | 0.2-1.2 (uniform) | Grasp stability, sliding tasks |
| Actuador gains (Kp, Kd) | 0.8x-1.2x nominal | Joint tracking accuracy |
| Action delay | 0-40ms random | Communication latency mismatch |
| Joint damping | 0.5x-2.0x nominal | Arm dynamics accuracy |
| Contact stiffness | 1e3-1e5 N/m | Contact dynamics fidelity |
Comparación de simulador: IsaacSim vs MuJoCo vs Génesis
| Feature | NVIDIA IsaacSim/Lab | MuJoCo (DeepMind) | Genesis |
|---|---|---|---|
| License | Free (NVIDIA Omniverse) | Apache 2.0 | Apache 2.0 |
| GPU parallelization | 4,096+ envs on A100 | 256-512 (MJX on GPU) | 10,000+ envs on single GPU |
| Rendering quality | Photorealistic (ray-traced) | Basic (OpenGL rasterizer) | Good (differentiable renderer) |
| Contact physics | PhysX (good rigid body) | Best-in-class contact solver | Good (differentiable) |
| Differentiable | Partial | Yes (MJX) | Yes (full pipeline) |
| Deformable objects | FEM soft body, cloth | Basic tendon/muscle model | MPM, SPH, FEM |
| Community/ecosystem | Large (NVIDIA-backed) | Largest (research standard) | Growing (open-source) |
| Best for | Visual policies, industrial sim | Locomotion, contact-rich tasks | Differentiable sim, soft body |
El servicio de entorno de RV de RCSV proporciona entornos MuJoCo y Isaac Lab preconfigurados calibrados para plataformas de hardware específicas, incluyendo el [OpenArm 1]
Medir la brecha de dominio: métodos cuantitativos
Antes de invertir en la adaptación de los dominios, mide la brecha cuantitativamente.
Métricas de cambio de distribución: Registrar 100 episodios de la misma tarea en simulación y en hardware real. Calcular la distancia Frechet entre las distribuciones de características de la imagen (utilizando una columna vertebral DINOv2) y las distribuciones de trayectoria de acción (utilizando distancia DTW).
** Prueba de transferencia de políticas:** Entrenar una política en la simulación, implementarla en hardware real y medir la brecha de tasa de éxito. Para una simulación bien calibrada con aleatorización de dominios, espere las siguientes brechas por tipo de tarea:
- Locomotora en tierra plana: 5-15% de diferencia (sim 95% → real 80-90%)
- Punto de selección de objetos rígidos: 15-30% de diferencia (sim 90% → real 60-75%)
- Incluir con precisión (±1 mm): diferencias de 30-50% (sim 85% → real 35-55%)
- Manipulación de objetos deformables: 40-60% de diferencia (sim 80% → real 20-40%)
Resultados recientes de Sim-to-Real: Lo que realmente funciona
Los siguientes resultados se obtienen de los trabajos publicados y de las pruebas internas del RCSV, que representan el estado de la práctica en 2025-2026:
DexPBT (NVIDIA, 2023): Entrenamiento basado en la población en IsaacGym para la manipulación hábil. Entrenado Allegro mano para reorientar objetos diversos. tasa de éxito Sim-real: 78% en objetos conocidos, 45% en objetos nuevos. Técnica clave: la aleatorización masiva de dominio en 4.096 entornos paralelos.
DexMV (UC San Diego, 2023): Utilizó demostraciones de video de mano humana para guiar el entrenamiento RL en simulación para la manipulación hábil.
Transferencia de locomotora (ETH Zurich/Unitree, 2024-2025): Las políticas de locomotora simuladas para Go2 cuadrupados logran un éxito de más del 95% en terreno plano, un 85% en terreno moderado, un 70% en terreno desafiante.
Sim-real híbrido para la manipulación (Inteligencia física, 2025): pi0 utiliza simulación para el entrenamiento previo de habilidades motoras gruesas, luego sintoniza en 50-200 demostraciones reales por tarea. Este enfoque híbrido logra tasas de éxito más altas que el entrenamiento solo en sim o solo en realidad, con una reducción de 5-10 veces en los requisitos de datos reales en comparación con el solo en realidad.
Cuando funciona Sim-to-Real y cuando no funciona
** Sim-to-real funciona bien para:**
- Locomotora y navegación (la dinámica de la carrocería rígida está bien modelada)
- Planificación de movimiento del brazo en el espacio libre (transferencia cinemática perfectamente)
- Objeto rígido de agarre con la aleatorización de dominio (la brecha es pujante)
- Pre-entrenamiento visual con la columna vertebral del modelo de fundación (se abstrae la brecha visual)
- Inicialización de comportamiento grosero antes de ajuste fino de datos reales
** Sim-to-real lucha con:**
- Manipulación de objetos deformables (telas, cables, alimentos)
Física demasiado compleja para modelar con precisión - Ensamblaje de precisión con tolerancias ajustadas (el desajuste del modelo de contacto es fatal)
- Uso de herramientas con una dinámica de contacto compleja (garrapatas, cortes, limpiezas)
- Tarea dependiendo de las propiedades del material (fritación, rigidez, textura de la superficie)
- Interacción de múltiples objetos con gráficos de contacto complejos
El estado de la técnica en 2026
Varias tendencias definen el panorama sim-to-real en 2026:
** Simulación acelerada a escala con GPU.** NVIDIA Isaac Sim y herramientas relacionadas permiten entrenar con miles de entornos paralelos en un solo grupo de GPU. Esto ha hecho que el aprendizaje de refuerzo en la simulación sea práctico para tareas que anteriormente requerían computación prohibitiva.
** Simulación diferenciable.** Simuladores como Genesis y Brax soportan el cálculo de gradientes a través del motor de física, permitiendo la optimización basada en gradientes para la identificación del sistema, la optimización de la trayectoria y el aprendizaje de políticas.
** Simulación generativa.** Se están utilizando grandes modelos generativos para crear datos de entrenamiento sintéticos realistas - renderización fotorrealista con diversos objetos, texturas y condiciones de iluminación - que complementan la simulación basada en la física. Empresas como 1X Technologies e Physical Intelligence han demostrado que el aumento de datos generativos mejora significativamente el rendimiento de las políticas en el mundo real.
Integración de modelos de base. Las políticas de simulación de simulación utilizan cada vez más las columnas vertebrales visuales de modelo de base (DINOv2, SigLIP) que se preparan a partir de datos a escala de Internet.
Híbridos de simulación real. Los equipos más exitosos en 2026 no tratan sim-to-real como una opción binaria. Utilizan la simulación para la formación inicial de políticas, la identificación del sistema para calibrar la simulación, la aleatorización de dominios para manejar la incertidumbre residual y una pequeña cantidad de datos reales para el ajuste final. Este enfoque híbrido produce consistentemente los mejores resultados en todos los tipos de tareas.
Elegir su enfoque
Para las tareas de locomoción y navegación, la simulación con capacitación de información privilegiada y la aleatorización de dominios es el ganador claro.
Para la manipulación de objetos rígidos (pick-and-place, pushing, ensamblaje básico), el enfoque híbrido funciona mejor: simulación de pre-entrenamiento con aleatorización de dominio, seguido de ajuste fino en 50-200 demostraciones reales. La simulación proporciona datos de entrenamiento diversos a bajo costo, y los datos reales corregir las discrepancias del modelo de contacto.
Para las tareas de precisión ricas en contactos y objetos deformables, priorizar la recopilación de datos reales. La brecha de sim a real para estas tareas es grande y difícil de superar con los métodos de adaptación de dominio actuales. Utilice la simulación para la exploración conductual inicial y la configuración de recompensas, pero planifique una recopilación de datos del mundo real significativa. Los [servicios de datos] de RCSV pueden manejar la recopilación de datos reales de alto volumen para estos complejos dominios de tareas, con programas piloto que comienzan en $2,500 para 200 demostraciones.
Para los equipos que trabajan con [hardware RCSV] (OpenArm 1, DK1, Unitree G1), nuestro [servicio de entorno de RL] (T6
Lectura relacionada
- [Por qué los datos de teleoperación superan a la simulación]
- Política de difusión para el aprendizaje de robots -- Formación en datos reales vs. simulados
- [¿Qué es los datos de entrenamiento de robots?]
- Revisar Unitree G1 -- Sim-to-real para la locomoción
- Servicio de Medio Ambiente de la RLVRC -- Ambientes de simulación precalibrados
- Servicios de datos del RCSV -- Recopilación de datos del mundo real para ajustes finos
- [Glosario]
T15 ) -- Dominio aleatorización, identificación del sistema, y más







