El desafío de la generalización: por qué las políticas de robots siguen fallando en 2026
Tratamiento técnico profundo de por qué las políticas de robots no generalizan: cambio de distribución, olvido catastrófico, fallos de composicionalidad y estrategias prácticas de mitigación para 2026.
[← Blog]
Una política que consigue un 95% de éxito en los objetos de entrenamiento puede fracasar por completo en un nuevo objeto.
Para una visión general más amplia de las estrategias de generalización, vea [Robot Policy Generalización: Why Your Robot Fails on New Objects]
La magnitud del problema
El fracaso de generalización es la mayor brecha entre las demostraciones de investigación de aprendizaje robótico y el despliegue de producción. Una política de manipulación entrenada en 300 demostraciones de "recoger la taza" utilizando 5 tazas rojas logra un 92% de éxito en esas tazas. Presenta la misma política con un vidrio transparente, un térmoso metálico o una taza de papel y el éxito cae al 10-30%. Este no es un escenario hipotético; es el comportamiento de base documentado de cada arquitectura de políticas importante probada hasta la fecha, incluidos ACT, Política de difusión y OpenVLA.
El problema es peor de lo que parece a partir de los números de referencia. La mayoría de las evaluaciones publicadas prueban la generalización dentro de bandas estrechas: la misma categoría de objetos con diferentes colores, la misma tabla con diferentes posiciones, la misma habitación con diferentes iluminaciones. La implementación en el mundo real requiere generalización simultánea en todos estos ejes a la vez, y los modos de falla se componen. Una política que maneje bien los nuevos colores y las nuevas posiciones bien por separado puede fracasar en la combinación de un nuevo color en una nueva posición, porque la representación no ha aprendido a factorizar estas dimensiones de forma independiente.
El cambio de distribución: el mecanismo fundamental
En el plano matemático, el fracaso de generalización es un problema de cambio de distribución. La política es un aproximador de función entrenado para minimizar las pérdidas en la distribución de formación P_train
El cambio de distribución en el aprendizaje de robots es más grave que en la clasificación de la visión por ordenador porque las consecuencias se componen con el tiempo. Una política que identifica erróneamente una observación genera una acción errónea, que cambia la siguiente observación, que puede estar aún más lejos de la distribución de entrenamiento, creando un fallo en cascada.
Tres mecanismos específicos impulsan el cambio de distribución en la manipulación de robots:
- Distribución visual: Las apariencias de objetos novedosos (color, textura, transparencia, reflexión) producen características visuales que el codificador no ha visto. El caso más peligroso son los objetos transparentes y reflectores, que producen patrones de píxeles fundamentalmente diferentes a los objetos opacos y matices que dominan la mayoría de los conjuntos de datos de entrenamiento. Los sensores de profundidad también fallan en objetos transparentes, eliminando el retroceso basado en la profundidad en el que algunas políticas dependen.
- Distribución geométrica: Las nuevas formas de objetos requieren diferentes configuraciones de agarre que la política no ha aprendido. Una política entrenada en tazas cilíndricas puede generar vectores de acercamiento apropiados para los cilindros cuando se presenta con una caja rectangular, porque ha aprendido una estrategia de agarre estrechamente vinculada a la geometría cilíndrica en sus datos de entrenamiento.
- Disposición dinámica: Las nuevas masas de objetos, los coeficientes de fricción y el cumplimiento cambian la dinámica de contacto durante la manipulación. Una política entrenada en objetos de plástico rígido genera fuerzas de agarre calibradas para plástico rígido. Presenta un objeto de espuma suave y la política lo aplasta (fuerza excesiva) o lo deja caer (fricción insuficiente). Este cambio es invisible a nivel visual y no se puede abordar solo mediante el aumento de datos visuales.
El olvido catastrófico en el aprendizaje continuo
Una respuesta natural al fracaso de generalización es recopilar más datos y reentrenar. Pero la reentrenamiento ingenuo introduce un segundo modo de fracaso: el olvido catastrófico. Cuando una política se ajusta a las nuevas categorías de objetos, pierde rendimiento en las categorías previamente dominadas a menos que se mezcle los datos antiguos en el conjunto de reentrenamiento. La causa fundamental es que las actualizaciones de parámetros de red neuronal que se optimizan para nuevos datos sobrescriben las representaciones que codificaron las capacidades antiguas.
El olvido catastrófico es particularmente insidioso en el aprendizaje de robots porque la recopilación de datos es costosa y el ciclo de entrenamiento-despliegue-retrain es lento. Un equipo descubre que su política falla en objetos transparentes. La política ahora maneja objetos transparentes, pero ha degradado un 15% en los objetos opacos que antes dominaba. Agregaban los datos antiguos y se retrenieron nuevamente, pero ahora el modelo necesita más capacidad o una programación más cuidadosa de la tasa de aprendizaje.
Las estrategias actuales de mitigación incluyen la repetición de la experiencia (mezclar datos antiguos y nuevos durante la reentrenamiento), la consolidación del peso elástico (penalizar los cambios en los parámetros importantes para las tareas antiguas) y las redes neuronales progresivas (asignar nueva capacidad de red para nuevas tareas). Ninguna de estas soluciones resuelve completamente el problema. El enfoque más práctico en 2026 es mantener un conjunto de datos completo y reentrenarse desde cero periódicamente, aceptando el costo computacional a cambio de un rendimiento fiable en varias categorías.
Composicionalidad: La generalización más difícil
La generalización de composición significa realizar combinaciones nuevas de elementos familiares. Una política entrenada en "recoger la taza del lado izquierdo de la mesa" y "recoger el tazón del lado derecho de la mesa" también debe manejar "recoger la taza del lado derecho de la mesa". Esto requiere que la política haya aprendido representaciones independientes para la identidad de los objetos y la ubicación espacial, en lugar de representaciones holísticas que los entrelacen.
En la práctica, la mayoría de las políticas de robots aprenden representaciones entrelazadas. No representan por separado "qué" y "dónde"; aprenden una representación combinada de "copa roja en posición izquierda" como un solo patrón. Esto significa que la generalización de composición normalmente requiere exponencialmente más datos de entrenamiento para cubrir el espacio combinatorial de posibles combinaciones de elementos. Para una tarea con 10 categorías de objetos, 5 posiciones y 3 condiciones de iluminación, lograr una generalización de composición sin una representación factorizada explícita podría requerir demostraciones que cubran una fracción significativa de las 150 combinaciones.
Las políticas de lenguaje condicionado (VLA) ofrecen un alivio parcial porque la instrucción de lenguaje proporciona una estructura de composición que la política puede aprender a seguir. "Coger la taza roja" y "recoger la taza azul" comparten el verbo y la estructura gramatical, alentando al modelo a aprender que la identidad del objeto es una variable separada de la acción. Sin embargo, la generalización de la composición en los VLAs sigue siendo frágil para tareas de manipulación precisas donde la secuencia de acción depende fuertemente de la geometría de objetos específicos.
Medir la brecha de generalización: un protocolo riguroso
La generalización debe evaluarse explícitamente y por separado a lo largo de cada eje.
| Generalización Axis | Test Protocol | Typical Gap (2026) |
|---|---|---|
| Novel objects (same category) | 10 held-out objects, same task setup | 15-40% drop |
| Novel positions | Uniform random across full workspace | 10-25% drop |
| Novel backgrounds/lighting | Different room, table surface, ambient light | 25-50% drop |
| Novel object category | Different object type, same task verb | 40-70% drop |
| Compositional (object + position) | New combination of seen object and seen position | 20-45% drop |
Lo que realmente ayuda: clasificados por impacto
Basándose en las ablaciones publicadas y en los datos de evaluación propios del RCSV de las políticas implementadas, aquí se clasifican las intervenciones por su impacto en la generalización fuera de la distribución.
- ** Diversidad de objetos en los datos de formación (máximo impacto).** El entrenamiento en 15+ objetos realmente diferentes por categoría de tarea produce consistentemente la mayor mejora de generalización. No 15 variantes de color de la misma taza. Cada objeto distinto adicional reduce la brecha de generalización en 2-5 puntos porcentuales hasta aproximadamente 25-30 objetos, donde los rendimientos disminuyen. Esta es la intervención más cara y la más efectiva.
- Encodificadores visuales pre-entrenados. El uso de DINOv2 o SigLIP como la columna vertebral visual en lugar de entrenamiento desde cero proporciona características visuales que ya se generalizan en miles de categorías de objetos.
- Aumento visual agresivo. Reto de color aleatorio (hue +/-0.4), recorte aleatorio (85-100% del área de la imagen, redimensionado a original), brillo y contraste aleatorio y borrado gaussiano aplicado durante el entrenamiento. Estos aumentos son gratuitos (sin costo adicional de recopilación de datos) y proporcionan una mejora constante del 8-15% en las evaluaciones de objetos nuevos y entornos nuevos. No sustituyen la diversidad real de objetos, sino que son un fuerte complemento.
- Condicionamiento del lenguaje. El acondicionamiento de la política sobre descripciones de tareas ("recoger el contenedor") en lugar de ID de tareas obliga al modelo a fundamentar el comportamiento en un sentido semántico en lugar de patrones visuales. Esto ayuda más para la generalización de categorías de objetos y menos para la generalización geométrica precisa.
- ** Diversidad de posiciones en los datos de entrenamiento.** Diferencias en las posiciones de inicio de los objetos en un rango de más de 40 cm en cada dirección, incluidas las orientaciones.
- Recolección de datos multicomunidades. Recolectar demostraciones en 3+ entornos físicos distintos (tablas, fondos, iluminación diferentes) es la principal defensa contra el cambio de distribución visual. Esto es logísticamente más difícil que la diversidad de objetos porque requiere mover físicamente la configuración.
Formulación matemática de la brecha de generalización
La brecha de generalización se puede formalizar como la diferencia entre la pérdida esperada en la distribución y la pérdida esperada fuera de la distribución. L(pi, D) denoten la pérdida esperada de tareas de la política pi en la distribución D. La brecha de generalización es G = L(pi, D_deploy) - L(pi, D_train. Para una política bien entrenada, L(pi, D_train) es pequeña (alta tasa de éxito en los objetos de formación). La pregunta es cuánto se hace grande G a medida que D_deploy se desvía de D_train.
Empiricamente, G se escala con la distancia de distribución entre D_train y D_deploy, pero la relación es altamente no lineal. Los pequeños cambios (la misma categoría de objeto, diferente color) producen G de 5-15%. Los cambios moderados (la misma categoría, diferente forma) producen G de 20-40%. Y críticamente, G puede mostrar comportamiento de acantilado: el rendimiento se degrada suavemente hasta un umbral de distancia distributiva, luego se desploma abruptamente. Este efecto de acantilado se observa comúnmente en alrededor de 10 cm de desplazamiento posicional de la distribución de entrenamiento para tareas de manipulación precisas, y en alrededor de 20-30 grados de desplazamiento de orientación para las tareas de captura.
El efecto de acantilado tiene una explicación mecánica: el codificador visual de la política aprende patrones de campo receptivo sintonizados con las frecuencias espaciales de las observaciones de entrenamiento. Cuando el objeto se mueve lo suficientemente lejos como para que las características relevantes caigan fuera de las activaciones de campo receptivo aprendidas, la salida del codificador entra en una región del espacio de características donde el jefe de política no tiene señal de entrenamiento, y las acciones previstas se vuelven esencialmente aleatorias. Esto no es una degradación gradual, es una transición de fase.
Modelos de fundación y destilación: estado actual
Los modelos de base para la robótica (Octo, OpenVLA, pi0, RT-2-X) abordan la generalización proporcionando representaciones visuales y semánticas pre-entrenadas en diversos datos.
** Generalización de cero disparos:** Los modelos de base logran una tasa de éxito del 25-40% en objetos nuevos dentro de categorías familiares sin ajuste específico de tarea, en comparación con el 5-15% para las políticas desde cero.
Atulado a poca velocidad: Con 50-100 demostraciones específicas de tareas, un modelo de base a la perfección suele coincidir o superar una política de cero entrenada en 300-500 demostraciones.
Aproches de destilación: La destilación de conocimientos desde modelos de fundación grandes hasta modelos más pequeños listos para su implementación es un área activa. El enfoque estándar: utilizar un modelo grande (OpenVLA en parámetros 7B) para generar etiquetas de acción para un conjunto de datos grande sin etiquetar, luego entrenar un modelo compacto de estudiantes (50-200M parámetros) sobre estos datos pseudoetiquetados. Los estudiantes destilados suelen conservar el 80-90% del rendimiento de generalización del profesor a un costo de inferencia 10 a 50 veces menor. Esto hace posible el despliegue en el hardware de borde - una política destilada se ejecuta a 20Hz en un Jetson Orin, mientras que el modelo del profesor requiere una GPU A100.
La limitación de la generalización basada en el modelo de fundación: funciona mejor para la generalización visual y semántica (objetos nuevos que se ven diferentes pero funcionan de manera similar) y peor para la generalización geométrica y dinámica (objetos nuevos que requieren estrategias de manipulación fundamentalmente diferentes). Un modelo de fundación que ha visto 1.000 tazas diferentes generaliza bien a la 1.001a taza. No se generaliza bien a una barra de jabón húmeda, porque la estrategia de manipulación de un objeto deslizante deformable es fundamentalmente diferente de la estrategia de un recipiente rígido, y ninguna cantidad de diversidad visual en los datos pre-entrenamiento enseña esa diferencia.
El efecto del acantilado: evidencia empírica
El efecto de acantilado - donde el rendimiento de la política se degrada suavemente hasta un umbral y luego se derrumba abruptamente - ha sido documentado cuantitativamente en múltiples entornos.
| Perturbation Type | Graceful Degradation Range | Cliff Threshold | Post-Cliff Performance |
|---|---|---|---|
| Object position offset (tabletop pick) | 0-8 cm: 85-92% success | ~10 cm from training centroid | < 20% success |
| Object orientation (grasp tasks) | 0-15 deg: 80-90% | ~25-30 deg from training orientations | < 25% success |
| Camera displacement | 0-3 cm: 75-90% | ~5 cm from calibrated position | < 30% success |
| Lighting intensity change | +/- 30% lux: 80-90% | +/- 60% lux change | < 40% success |
| Background scene change | Minor changes: 85-90% | Complete scene change (new room) | < 35% success |
| Object mass change (pour/place) | +/- 50g: 80-90% | +/- 200g from training objects | < 30% success |
Estos umbrales son aproximados y varían según la arquitectura de las políticas y la diversidad de los datos de formación. La clave para la planificación de la implementación: identificar el rango de perturbaciones probable en su entorno de implementación y garantizar que sus datos de capacitación cubran al menos el 120% de ese rango para mantener el rendimiento por encima del umbral de acantilado con margen.
Cuadro de clasificación de generalización de SOTA (abril 2026)
La siguiente tabla recopila los mejores resultados de generalización reportados en las principales arquitecturas de políticas sobre protocolos de evaluación estandarizados.
| Model | Novel Objects (same cat.) | Novel Positions | Novel Environment | Training Demos |
|---|---|---|---|---|
| ACT (from scratch) | 52% | 68% | 35% | 200 |
| ACT + DINOv2 backbone | 67% | 75% | 52% | 200 |
| Diffusion Policy | 58% | 72% | 40% | 300 |
| Octo (zero-shot) | 35% | 42% | 28% | 0 (pre-trained) |
| Octo (fine-tuned, 100 demos) | 68% | 76% | 55% | 100 |
| OpenVLA (fine-tuned, 100 demos) | 72% | 78% | 58% | 100 |
| pi0 (fine-tuned, 50 demos) | 75% | 80% | 60% | 50 |
| RoboAgent (diverse data) | 82% | 85% | 62% | 800 (diverse) |
Las principales conclusiones: (1) el ajuste del modelo de base logra una generalización comparable a la formación desde cero con 3-5 veces menos demostraciones. (2) La diversidad de datos (RoboAgent) sigue superando la escala del modelo cuando se mide por demostración. (3) La generalización del entorno novedoso sigue siendo el eje más difícil para todas las arquitecturas, sin método que exceda del 62% en la evaluación estandarizada. (4) La combinación de base de modelo de base + datos de ajuste fino diversos (pi0 + recopilación dirigida) representa el óptimo práctico actual.
Estrategias prácticas de mitigación por tamaño de equipo
La estrategia de mitigación adecuada depende de los recursos de su equipo.
** Investigador en solitario / equipo de 1-2 personas.** Utilice un modelo de base (Octo o OpenVLA) como punto de partida. Recoge 50-100 demostraciones diversas sobre su tarea específica con al menos 10 objetos distintos y 3+ condiciones de iluminación. Aplique aumento visual agresivo (tiempo de rocío de color, cosecha aleatoria, borbullo gaussiano). Generalización esperada: 60-70% en objetos nuevos de la misma categoría. Presupuesto: $2,000-5,000 en computación + tiempo de recopilación de datos.
Equipo de laboratorio pequeño / 3-10 personas. Afinar un modelo de base en 200-500 demostraciones recogidas en más de 15 objetos, 3 entornos y con etiquetas de instrucción de lenguaje. Implementar una evaluación sistemática con conjuntos de pruebas realizados a lo largo de cada eje. Utilice la recopilación de datos de estilo DAgger para apuntar a modos de falla específicos. Generalización esperada: 70-80% en objetos nuevos. Presupuesto: $ 10.000-30.000 incluyendo tiempo de hardware y computación.
Equipo de producción / empresa. Construye una línea de recopilación continua de datos. Mantenga una biblioteca de objetos diversa (50+ objetos en sus categorías objetivo). Recoge en entornos de producción, no solo en configuraciones de laboratorio. Reentren semanalmente o mensualmente a medida que se acumulan nuevos datos. Implemente conjuntos de evaluación automatizados que se ejecutan en cada versión de modelo. Objetivo: Generalización del 85%+ en condiciones de implementación relevantes. Presupuesto: entre 50.000 y 200.000 dólares al año para las operaciones de datos.
Protocolos de evaluación para la generalización
La evaluación de la generalización rigurosa requiere conjuntos de ensayos estructurados a lo largo de cada eje.
- Protocolo de separación: Reserve el 20% de su conjunto de objetos como objetos de prueba retenidos que nunca se utilizan en el entrenamiento. Reserve el 20% de sus posiciones en el espacio de trabajo como posiciones de prueba retenidas. Evaluar el producto cruzado de los objetos de prueba en posiciones de prueba para la prueba de generalización más fuerte.
- Conte de ensayos mínimo: Realice al menos 20 ensayos por condición de ensayo para lograr la significación estadística. Informar las tasas de éxito con intervalos de confianza del 95% (intervalos de puntuación de Wilson para las proporciones binomial). Una evaluación de 20 ensayos con tasa de éxito del 80% tiene un CI del 95% de [56%, 94%] - lo suficientemente amplio como para que las diferencias de un dígito entre los métodos no sean significativas.
- Termoración sistemática: Más allá de la evaluación aleatoria, prueba los ejes de perturbación específicos individualmente: mueva la cámara a 5 cm de su posición de entrenamiento; cambie la superficie de la mesa (agrega un pañuelo de mesa, cambia el color); cambie el fondo (agrega/remueve objetos detrás del espacio de trabajo); cambie la iluminación (fluorescente a LED, agrega/remueve una fuente de luz de ventana). Esto revela a qué perturbaciones es más sensible la política, guiando la recopilación de datos dirigidos.
- Informe de resultados por eje: No agregue los resultados de generalización en un solo número. Informe el éxito de los objetos novedosos, el éxito de los objetos novedosos, el éxito de los entornos novedosos y el éxito de los objetos compositores por separado.
La frontera de 2026: qué es mejor y qué no
Los modelos de fundación para la robótica (Octo, OpenVLA, pi0) están mejorando constantemente la generalización de disparos cero a objetos nuevos dentro de categorías familiares. La brecha entre un modelo de fundación afinado y una política de cero en evaluaciones de objetos nuevos se ha ampliado de aproximadamente el 15% en 2024 a 25-30% en 2026, lo que significa que los modelos de fundación están avanzando en los puntos de referencia de generalización.
Lo que no está mejorando tan rápido: generalización geométrica precisa (manejar formas de objetos verdaderamente novedosas que requieren diferentes estrategias de captura), generalización dinámica (manejar objetos con nuevas propiedades físicas) y generalización de composición en múltiples pasos (execución de nuevas secuencias de habilidades familiares). Estos siguen siendo problemas difíciles que la escala de datos y la escala de modelos aún no han resuelto.
Los servicios de recogida de datos de RCSV están estructurados específicamente para maximizar las intervenciones que funcionan: conjuntos de objetos diversos, colocaciones variadas, múltiples entornos y protocolos de evaluación estandarizados con objetos de prueba retenidos. Si su política no está funcionando en generalización, la acción más impactante es casi siempre mejorar la diversidad de datos de formación, y eso es exactamente lo que nos especializamos.
Lectura relacionada
- [Generalización de la política de robots: por qué su robot falla en nuevos objetos]
- [Leyes de escala para el aprendizaje de robots: lo que sabemos en 2026]
- [Aprendizaje por imitación para robots: desde las demostraciones hasta la implementación]
- [Abrir el cuerpo X: el conjunto de datos del robot que cambió todo]
- [Política de ACT vs. Difusión: cuándo usar cuál]
- [Servicios de recogida de datos del RCSV]
Recopilación de datos diseñada para generalización
El RCSV estructura la recopilación de datos para maximizar la generalización de políticas a través de diversos objetos, ambientes variados y evaluación sistemática con conjuntos de pruebas prolongadas.
[Explorar los Servicios de Datos]







