Por qué los datos de teleoperatoria aún superan a la simulación para entrenar las políticas de robots
A pesar de los avances en la simulación, las demostraciones reales de teleoperaciones siguen siendo el estándar de oro para las políticas de entrenamiento de manipulación.
Parte de: [Guía de la teleoperación]
[← Blog]
La brecha entre sim y real se está reduciendo
La brecha persistente entre Sim y realidad
La simulación ha recorrido un largo camino. Isaac Lab hace física de cuerpos rígidos a miles de fotogramas por segundo. MuJoCo MPC cierra los bucles de manipulación en milisegundos. Sin embargo, cada equipo que ha intentado enviar una política rica en contactos entrenada puramente en simulación ha encontrado el mismo muro: el mundo real no se comporta de la manera que predice el simulador, y la política falla de maneras que son difíciles de diagnosticar y costosas de arreglar.
El problema principal es el modelado de contacto. Cuando un dedo robot toca una barra de jabón, la rigidez de contacto, el coeficiente de fricción y la micro geometría superficial interactúan para determinar si la barra se desliza, rodea o se queda. El jabón de silicona real en una superficie ABS húmeda tiene un coeficiente de fricción que varía con la velocidad de deslizamiento, la fuerza normal y la humedad de la superficie de manera que ningún motor físico actualmente modela con precisión.
La riqueza del contacto: lo que no puede captar la simulación
Las tareas de manipulación ricas en contactos
| Contact Property | Sim Fidelity | Real-World Complexity | Gap Severity |
|---|---|---|---|
| Static friction coefficient | Single scalar per pair | Varies with normal force, velocity, surface wear, moisture | High |
| Contact patch geometry | Point/line contact models | Deformable patch with pressure distribution | High |
| Surface micro-geometry | Not modeled | Micro-roughness, grain direction, surface coatings | Moderate |
| Soft body deformation | FEM or MPM (slow, approximate) | Viscoelastic, rate-dependent, non-linear | Very high |
| Actuador dynamics | Idealized motor models | Backlash, cable stretch, thermal drift, gear wear | Moderate |
| Visual appearance under contact | PBR rendering (improving) | Specular reflections, shadows from gripper, occlusion | Low-moderate |
El efecto compuesto de estas lagunas es lo que hace que la transferencia sim-a-real para las tareas de contacto sea tan difícil. Cada aproximación individual puede introducir solo un pequeño error, pero los errores en la fricción, la geometría y la dinámica se componen multiplicativamente durante una secuencia de contacto de múltiples pasos. Una tarea de inserción de 10 pasos con un error de 5% por paso por las inexactitudes de modelado de contacto da 0,95^10 = 60% de éxito general
El cambio de distribución: la evidencia cuantitativa
El cambio de distribución se refiere a la discrepancia entre la distribución estatal que una política ve durante la capacitación y la distribución estatal que encuentra durante el despliegue.
Distribución visual: A pesar de los avances en la randomización de dominios y la representación neuronal, las imágenes simuladas siguen siendo distributivamente diferentes de las imágenes reales de la cámara. Este cambio es medible: la FID (Frechet Inception Distance) entre las escenas de manipulación presentadas por IsaacSim y las capturas reales de las mismas escenas de RealSense es típicamente 80-120, en comparación con 20-40 entre diferentes configuraciones de cámaras reales.
Dynamics distribution shift: Incluso cuando la transferencia visual tiene éxito (a través de la randomización de dominios o la representación de imágenes reales), la falta de coincidencia dinámica crea trayectorias de estado durante la implementación que la política nunca vio durante la capacitación. En realidad, el brazo sigue trayectorias ligeramente diferentes debido a errores de modelado del actuador, lo que resulta en configuraciones de enfoque de captura que están fuera de distribución para la política.
Por qué las manifestaciones humanas capturan la distribución correcta
Cuando un operador experto teleopera un brazo robótico para recoger una barra de jabón, no está siguiendo una trayectoria computada. Están utilizando las mismas heurísticas sensoriomotoras que la evolución pasó millones de años optimizando. Instintivamente ajustan el ángulo de acercamiento cuando ven una superficie redondeada. Sienten (a través de retroalimentación háptica o señales visuales) cuando un agarre es inestable y correcto antes de fallar. Encontran configuraciones de agarre que no son globales pero son estable localmente exactamente el tipo de soluciones que se transfieren al despliegue.
Esto significa que las demostraciones de teleoperaciones codifican implícitamente dos cosas que la simulación no puede proporcionar fácilmente: ** la distribución correcta de tareas** (el conjunto de poses de objetos, estrategias de captura y secuencias de acción que realmente funcionan en el mundo físico) y ** satisfacción implícita de las restricciones** (un operador experto nunca intenta comprender que su experiencia les dice que fallará
Hay un tercer beneficio, a menudo pasado por alto: ** información de dinámica implícita**. Cuando un operador ajusta su fuerza de agarre en la mitad de la trayectoria porque siente un deslizamiento, está codificando el coeficiente de fricción real en la trayectoria de demostración. Cuando ralentiza el acercamiento porque el objeto está posicionado incómodo, está codificando las restricciones cinemáticas reales. Esta información dinámica es "libre"
La brecha entre Sim y Real por tipo de tarea: evidencia cuantitativa
La magnitud de la brecha entre sim y real varía dramáticamente según el tipo de tarea.
| Task Type | Sim Success | Real Success (Sim Policy) | Real Success (Teleop Data) | Demos Needed |
|---|---|---|---|---|
| Pick-place (rigid, top-down) | 95% | 75-85% | 90-95% | 100-200 |
| Peg-in-hole (1mm clearance) | 90% | 30-50% | 80-90% | 200-400 |
| Deformable manipulation (cloth) | 80% | 15-30% | 65-80% | 300-600 |
| Cable routing / insertion | 70% | 10-25% | 70-85% | 400-800 |
| Liquid pouring | 85% | 20-40% | 75-90% | 150-300 |
| Tool use (e.g., screwdriver) | 75% | 5-15% | 60-75% | 500-1000 |
El patrón es claro: las tareas con una dinámica de contacto más rica muestran una brecha mayor de sim a real. Para el pick-place rígido de arriba hacia abajo, la brecha es de 10-20 puntos porcentuales
Comparación de costes por calidad y demografía
Una objeción común a los enfoques de datos reales es el costo. Los datos de simulación son "libres" una vez que tienes el entorno; las demostraciones reales requieren operadores, hardware y tiempo. Pero este marco ignora el costo de la calidad de la demostración que finalmente determina el rendimiento de la política:
| Data Source | Cost/Demo | Demos for 80% Success | Total Cost to 80% | Time to 80% |
|---|---|---|---|---|
| Sim-only (Isaac Sim) | ~$0.001 | Often unreachable for contact tasks | N/A (ceiling ~50-60%) | 2-4 weeks sim engineering |
| Sim + domain rand (tuned) | ~$0.01 (compute) | 500K-1M episodes | $5K-10K compute + 4-8 weeks engineering | 4-8 weeks |
| Real teleop (in-house) | $15-30 | 200-400 | $3K-12K + hardware setup | 2-3 weeks |
| Real teleop (RCSV managed) | $8-16 | 200-400 | $2,500 pilot / $8,000 campaign | 1-2 weeks |
| Hybrid (sim pre-train + real fine-tune) | $0.01 sim + $10 real | 50K sim + 100-200 real | $2K-5K total | 3-4 weeks |
La clave: para las tareas ricas en contactos, la simulación por sí sola a menudo no puede alcanzar la tasa de éxito objetivo a cualquier costo, porque el límite de rendimiento está limitado por la fidelidad de la modelación de contactos. Los datos reales alcanzan el objetivo más rápido y de manera más predecible, y el camino de recopilación gestionada (servicios de datos de RCSV) elimina el gasto general de establecer su propia infraestructura de recopilación.
Tres estudios de casos en los que la simulación falla
- Creo de barras de jabón: Seis equipos de toda la industria informaron que las políticas entrenadas en Isaac Sim con parámetros de fricción PBR predeterminados lograron un éxito de > 80% en la simulación pero < 40% en el hardware real.
- Inserción de cable: La geometría deformable no se resuelve en los motores de física en tiempo real. La deformación de un cable USB-C bajo contacto con los dedos depende de su tensión específica de trenza, rigidez de la chaqueta y cumplimiento del núcleo. Las políticas de simulación para el enrutamiento de cables logran aproximadamente un 20% de éxito en el tiempo real; las políticas de teleoperación entrenadas con 500 demostraciones logran un 70-80%.
- Vulsión de líquidos: La simulación de la dinámica de los fluidos a la escala de una taza de agua es computacionalmente tratable con SPH o métodos basados en la red, pero la interacción entre el fluido, la geometría del borde de la taza y la tensión superficial es lo suficientemente compleja como para que las políticas simuladas por simulación se sobreponan sistemáticamente.
Lo que la simulación realmente hace correcto
Este no es un argumento contra la simulación
- ** Planificación de movimiento en el espacio libre:** La generación de trayectorias libres de colisión en entornos conocidos transfiere bien de la sim a la real.
- ** Generación de escenas diversas:** La simulación puede generar miles de poses de objetos, configuraciones de tablas y diseños de entornos que tardarían semanas en configurarse físicamente.
- Escala de datos infinita para comportamientos gruesos: Hacer que un robot se oriente aproximadamente hacia un objetivo, se acerque a un objeto o navegar por un pasillo puede ser arrancado de millones de episodios simulados.
- Pre-entrenamiento de codificadores visuales: Entrenamiento de una columna vertebral visual en millones de escenas simuladas con diversas apariencias de objetos, condiciones de iluminación y puntos de vista de la cámara produce representaciones que se transfieren bien a cámaras reales.
Cuando los datos de simulación ayudan: el caso pre-entrenamiento
El argumento más fuerte para los datos de simulación no es como fuente primaria de formación sino como etapa de pre-entrenamiento.
1. Pre-entrenamiento de representación visual. Entrenar una columna vertebral ResNet-50 o ViT en escenas simuladas de 1M con la aleatorización de dominios. El codificador resultante aprende características de nivel de objeto (extremidades, formas, relaciones espaciales) que se transfieren a cámaras reales. La ajuste fino en 200 demostraciones reales requiere 3-5 veces menos iteraciones en comparación con el entrenamiento desde cero, y la política resultante se generaliza mejor a nuevos puntos de vista de la cámara y condiciones de iluminación.
2. Inicialización de habilidades motoras gruesas. Pre-entrenar una política en 100K episodios simulados para aprender el movimiento grueso primitivo (objeto de aproximación, agarre de orientación, dedos cerrados). Esto reduce el requerimiento real de datos de 500 demos a 100-200 demos para muchas tareas, porque el ajuste real sólo necesita corregir el comportamiento de la fase de contacto en lugar de aprender toda la trayectoria desde cero.
3. Descubrimiento de modo de falla. Ejecutar la política sim en escenarios aleatorios 10K y catalogar los modos de falla. Utilice este catálogo para diseñar una colección de datos reales dirigida
Los enfoques híbridos: el límite práctico
Los equipos más eficaces en 2025 no están eligiendo entre sim y real
** Sim pre-train + real fine-tune (el enfoque estándar):** Entrenamiento en sim, fine-tune en 100-500 demostraciones reales. Funciona bien para tareas donde la política de sim alcanza el 40-60% de éxito real. Mejora esperada: 20-40 puntos porcentuales de la fine-tune. Esto es lo que pi0, OpenVLA y la mayoría de los sistemas basados en VLA usan para la especialización de tareas.
Real backbone + sim augmentation: Entrenar la política primaria en datos reales, luego aumentar con datos sim a una relación real:sim de 1:3 a 1:5 . Los datos sim proporcionan una cobertura del espacio-estado que tomaría semanas para recopilar en realidad.
Sim para exploración + real para refinamiento: Utilice RL en sim para descubrir nuevas soluciones a tareas difíciles (por ejemplo, estrategias de uso de herramientas, secuencias de re-grap). Extraer las estrategias descubiertas como secuencias de puntos de ruta. Luego recoger demostraciones reales siguiendo estas estrategias y entrenar una política real. Este enfoque aprovecha la capacidad de Sim para explorar millones de trayectorias evitando el problema de modelado de contacto durante el despliegue.
El enfoque de teleoperatoria del RCSV
La metodología de recopilación de datos de RCSV está diseñada específicamente para maximizar la relación señal-ruido en datos de demostración reales.
- ** Protocolo de variación estructurada:** En lugar de recopilar todas las demostraciones en una sola configuración de escena, variamos sistemáticamente las posiciones de los objetos, las orientaciones y los fondos de la escena en una cuadrícula predefinida. Esto asegura que el conjunto de datos cubra los ejes de variación que importan para la generalización, en lugar de representar demasiado una sola configuración.
- ** Sistema de nivel de operador:** Los operadores menores (semanas 1-2 de formación) recogen tareas L1 (posición de selección simple). Los operadores mayores (1+ meses de experiencia) manejan tareas L2 (manipulamiento en múltiples pasos). Los líderes de QA (3+ meses) manejan tareas L3 (inserción de precisión, uso de herramientas). Esta combinación de habilidades del operador con la complejidad de la tarea maximiza la calidad de la demostración en cada nivel de dificultad.
- Tres puertas de calidad: Cada demostración pasa por (1) controles heurísticos automatizados (limites de velocidad, límites de espacio de trabajo, longitud de episodio), (2) clasificador de calidad basado en ML entrenado en episodios con etiqueta de 50K + y (3) revisión de control en el lugar humano a una tasa de muestreo del 10%.
- ** Normalización del hardware:** Toda la recogida se realiza en estaciones de trabajo calibradas y estandarizadas utilizando OpenArm 1 ($ 4,500) o configuraciones bimanual DK1 con grabación sincronizada de múltiples cámaras. Esto elimina el ruido específico del hardware que degrada la formación de políticas en diferentes configuraciones de recogida.
El resultado: los conjuntos de datos recogidos por el RCSV logran consistentemente tasas de éxito de políticas de 15 a 25% más altas que los conjuntos de datos de tamaño equivalente recogidos en configuraciones ad hoc, basados en comparaciones entre 12 tareas de las arquitecturas de políticas de ACT y difusión.
El modelo mental correcto: grosero en Sim, bueno en realidad
El enfoque más efectivo que hemos visto es una estrategia de dos fases. En la primera fase, utiliza la simulación para entrenar un amplio previo: el robot aprende a acercarse a objetos, estimar los candidatos de agarre y ejecutar movimientos de selección aproximados en miles de categorías de objetos. Esta fase puede funcionar de la noche a la mañana en un solo A100 y produce una política que se encuentra dentro de 10 cm de la agarre correcta ~ 90% del tiempo.
En la segunda fase, recoger 200-500 demostraciones reales de teleoperación sobre la tarea específica. Afinar el modelo simulado con entrenamiento preliminar sobre estos datos reales. La combinación suele superar los enfoques solo sim o solo reales, y reduce el requerimiento de datos reales en 5-10 veces en comparación con el entrenamiento desde cero.
Observaciones del RCSV de los trabajos de recopilación de datos
En decenas de proyectos de recopilación de datos en RCSV, hemos observado constantemente que la calidad de los datos supera la cantidad de datos para las tareas de contacto. Los operadores expertos instintivamente evitan las demostraciones que confundirán la política
También hemos observado que las primeras 200 demostraciones muestran un rendimiento decreciente en la mayoría de las tareas de complejidad L2 (pico estructurado). Las siguientes 300 demostraciones mejoran la robustez de las nuevas poses de objetos. Más allá de 500, la mejora adicional requiere la introducción de nuevas instancias de objetos y variaciones ambientales
La estrategia híbrida en práctica
Nuestro enfoque recomendado para los equipos que inician una nueva tarea de manipulación: (1) crear o descargar un entorno de simulación para el pre-entrenamiento de comportamiento grueso, (2) ejecutar 50K-100K pasos de simulación para iniciar la política, (3) recopilar 300-500 demostraciones reales de teleoperación a través de un protocolo estructurado de recopilación de datos, (4) ajustar a la perfección, (5) evaluar en 3 nuevas condiciones en las que no ha entrenado. Este conjunto de medidas generalmente produce políticas listas para su implementación en 4-6 semanas en lugar de los 3-6 meses requeridos para los enfoques solo en simulación.
# Ejemplo de tubería híbrida (pseudocode) # Fase 1: Sim pre-entrenamiento python train.py \ --data sim_dataset/ \ --epochs 100 \ --backbone resnet50 \ --domain-rand visual+physics \ --save checkpoint_sim.pt # Fase 2: Real ajuste fino python train.py \ --data real_teleop_dataset/ \ --epochs 50 \ --backbone resnet50 \ --resume checkpoint_sim.pt \ --lr 1e-4 \ # LR inferior para ajuste fino --freeze-backbone 10 # congela el codificador visual para los primeros 10 años # Fase 3: Evaluar python.py \ --checkpoint\fin_et. -- -- --evolution-scenes \ \ \ scenes / novelas --check-numbers 100
Para los equipos que quieran comenzar a recopilar datos reales de demostración hoy, los servicios de recopilación de datos de RCSV proveen a operadores capacitados, hardware calibrado y una tubería de calidad estructurada para que pueda obtener datos limpios y listos para políticas sin construir la infraestructura usted mismo. Los proyectos piloto comienzan en $2,500 para 200 demostraciones; campañas completas en $8,000 para más de 1,000 demostraciones con garantías de calidad.
Lectura relacionada
- [Guía de datos de formación de robots]
- [Transferencia de Sim a Real]
- [Política de difusión para los robots]
- [Equipos de recopilación de datos de escala]
- [Annotación de datos de robots]
- [Modelos de VLA explicados]
- [Servicios de datos]
- [Plataforma del RCSV]
- [Glosario]
Comience a recoger demostraciones reales de robots
RCSV proporciona operadores capacitados, hardware OpenArm 1 y una línea de calidad completa para la recogida de demostraciones de robots.
[Explorar los servicios de datos]







