Volver a Blog

Generalización de las políticas de robots: por qué es difícil y qué funciona en 2026

Por qué las políticas de robots no generalizan: tipos de cambio de distribución, soluciones desde el aumento de datos hasta modelos de base, qué generaliza realmente en 2026, y cómo medirlo.

Su política logra un 90% de éxito en los objetos de entrenamiento. Introducen una taza nueva, cambian la iluminación, mueven la mesa a la izquierda, y el rendimiento cae al 30%. Este es el problema de generalización, y sigue siendo el desafío central que se encuentra entre el aprendizaje de robots en el laboratorio y el aprendizaje de robots en el mundo real.

Lo que significa realmente la generalización

Una política de robot generaliza cuando realiza con éxito una tarea en condiciones no presentes en sus datos de capacitación. Esto es fundamentalmente diferente de la memorización, donde la política reproduce secuencias de movimiento específicas vinculadas a entradas visuales específicas. Una política generalizadora ha aprendido el concepto de tarea - recoger el recipiente, verter el líquido, insertar el peg - y puede ejecutar ese concepto a través de variaciones en la apariencia del objeto, posición, iluminación e incluso composición de la tarea.

La generalización no es binaria. Existe en un espectro, y diferentes ejes de generalización presentan diferentes niveles de dificultad. Una política puede generalizar bien a través de los colores de los objetos (fácil) pero no a través de las formas de los objetos (duro). Comprender qué ejes de generalización son importantes para su escenario de implementación es el primer paso hacia el diseño de una estrategia de recopilación de datos que los aborde.

Tipos de cambio de distribución

El cambio de distribución visual ocurre cuando la apariencia visual del entorno de despliegue difiere de la formación. Esto incluye cambios en la iluminación (celular cálido frente a la luz fría frente a la mezcla), la apariencia de los objetos (marca diferente de taza, color diferente, reflexión diferente de material), desorden de fondo (espacio de trabajo limpio frente a escritorio desordenado) y las propiedades de la cámara (diferencias leves en posición, exposición, balance de blanco). El cambio visual es la causa más común de fracaso de generalización en las políticas basadas en la visión y la más susceptible a las soluciones del lado de los datos.

El cambio de distribución física ocurre cuando las propiedades físicas de los objetos o del entorno difieren de las de la formación. Una política entrenada en tazas de plástico rígidas puede fallar en tazas de papel blandas porque la dinámica de agarre es diferente. Una política entrenada en una superficie lisa de mesa puede fallar en una tela texturizada debido a que los coeficientes de fricción cambian. El cambio físico es más difícil de abordar solo mediante el aumento de datos porque requiere que la política aprenda diferentes estrategias físicas, no solo reconozca diferentes patrones visuales.

Variación de tarea ocurre cuando el objetivo o la estructura de la tarea cambia. Una política entrenada para colocar objetos en una ubicación específica de destino no puede generalizarse a la colocación de objetos en ubicaciones arbitrarias especificadas a través del lenguaje o el gesto. Una política entrenada en la selección y ubicación de un solo objeto puede fallar cuando se le pide que maneje escenas con múltiples objetos que requieren decisiones de secuenciación. La variación de tareas es la forma más difícil de generalización y por lo general requiere de un condicionamiento del lenguaje o arquitecturas explícitas de descomposición de tareas.

Soluciones que funcionan: enfoques de la parte de los datos

Diversificación de conjuntos de datos deliberada es el enfoque más confiable para mejorar la generalización. Para la diversidad de objetos, recoger demostraciones con al menos 10-20 instancias distintas de cada categoría de objetos objetivo, de tamaño, color, material y marca variables. Para la diversidad de posición, varía las posiciones de inicio en una cuadrícula de 30-40 cm e incluye diferentes orientaciones de objetos. Para la diversidad ambiental, cambie las condiciones de iluminación (un mínimo de 3 configuraciones distintas), las superficies de la mesa y los niveles de desorden de fondo durante las sesiones de recogida.

Aumento de datos complementa la diversidad real con variaciones generadas sintéticamente. Los aumentos más avanzados que utilizan modelos generativos para pegar nuevas texturas en objetos o cambiar fondos pueden extender la diversidad efectiva de un conjunto de datos sin recopilar demostraciones adicionales. Sin embargo, el aumento no puede sustituir la diversidad en geometría de objetos, estrategia de captura o dinámica física. Utilice el aumento para ampliar la diversidad visual, no para evitar la recolección con objetos diversos.

Randomization de dominio es el análogo de la diversificación de datos en la simulación. Al randomisar los parámetros visuales y físicos durante el entrenamiento sim-to-real, las políticas aprenden características que son invariantes a la configuración de simulación específica y, por lo tanto, más robustas cuando se transfieren al hardware real. La aleatorización efectiva de dominios requiere la aleatorización de los parámetros correctos en los rangos correctos -- la sub-aleatorización deja lagunas que el mundo real explota, mientras que la excesivamente aleatorización hace que el problema de aprendizaje sea innecesariamente difícil.

Soluciones que funcionan: enfoques arquitectónicos

Condicionamiento del lenguaje permite a una política generalizarse en las variaciones de tareas aceptando instrucciones de lenguaje natural como entrada. Una política de lenguaje condicionada entrenada en "coger la taza roja" y "coger el tazón azul" a menudo se puede generalizar a "coger la botella verde" - incluso si las botellas verdes nunca fueron vistas durante el entrenamiento - porque la tierra de la lenguaje de visión proporciona una comprensión semántica de lo que buscar. Modelos como [RT-2, OpenVLA y Octo]T3) han demostrado una generalización significativa en tareas de manipulación.

Las columnas vertebrales del modelo de base proporcionan representaciones visuales y semánticas que se han formado en datos a escala de Internet, dando a las políticas acceso a un conocimiento visual mucho más grande de lo que cualquier conjunto de datos de robots podría proporcionar. El uso de un [encoder visual pre-entrenado por video] (R3M, SPA, DINOv2) o un modelo de lenguaje de visión pre-entrenado (CLIP, SigLIP) como la columna vertebral de la política mejora consistentemente la generalización a nuevos objetos porque la columna vertebral ya ha aprendido a reconocer miles de categorías de objetos.

Arquitecturas de políticas de difusión modelan la distribución de acción como un proceso de difusión denociante, que naturalmente maneja las distribuciones de acción multimodal - la misma observación puede conducir a múltiples acciones válidas. Esta elección arquitectónica mejora la generalización porque la política no se ve obligada a comprometerse con una única estrategia de acción y puede representar enfoques diversos para la misma tarea. Las políticas de difusión han mostrado una generalización particularmente fuerte en las tareas en las que son válidas múltiples estrategias de captura.

Lo que realmente generaliza bien (y lo que no)

La locomoción se generaliza bien. Las políticas de caminar, correr y cruzar terreno accidentado se transfieren de manera fiable a través de tipos de superficie, pendientes y pequeñas variaciones de terreno. Esto se debe a que la locomoción depende principalmente de la dinámica (torques conjuntos, fuerzas de reacción del suelo) en lugar de la percepción visual de granos finos, y la dinámica es relativamente consistente en todos los entornos. Las políticas de locomoción de piernas entrenadas en simulación con aleatorización de dominio logran consistentemente un rendimiento de simulación cercano en hardware real.

El captado básico se generaliza moderadamente bien. Las políticas de pick-and-place para objetos rígidos con accesos de captura claros (tasas, cajas, herramientas) pueden generalizarse a nuevas instancias de objetos dentro de categorías entrenadas, especialmente cuando se utilizan espinas de modelo de base. El requisito clave es la diversidad de objetos suficiente en el entrenamiento - 10 o más casos por categoría es el umbral práctico donde la generalización se vuelve confiable.

La manipulación externa generaliza poco. Las tareas que requieren una colocación precisa del dedo, una reorientación en la mano o una interacción rica en contactos (peg-in-hole, apareamiento de conectores, uso de herramientas con control fino) siguen siendo difíciles de generalizar. Las políticas de manipulación dexterosas generalmente requieren demostraciones específicas de tareas con los objetos exactos y las condiciones ambientales del despliegue.

Las tareas de largo horizonte se generalizan mal. Las tareas compuestas de muchos pasos secuenciales generalizan errores de generalización compuesta - una probabilidad de fracaso del 5% por paso conduce a un 40% de fracaso de tarea en 10 pasos. La generalización de largo horizonte requiere descomponer la tarea en subpolíticas generalizadoras independientemente o usar abstracciones a nivel de planificación que pueden recuperarse de los fallos de los pasos individuales.

Medir la generalización: hacerlo bien

La generalización debe medirse explícitamente a través de un protocolo de evaluación estructurada, no deducido del rendimiento en la distribución.

  • Objetos retirados: Reserve 5-10 instancias de objetos por categoría que nunca se utilizan durante el entrenamiento.
  • Posiciones de salida: Evaluar en posiciones de partida de objetos no incluidas en la distribución de formación, incluidas las posiciones en los bordes del espacio de trabajo y las orientaciones que eran raras en la formación.
  • Entornos de mantenimiento: Si es posible, evalúe en una configuración física que difiera de la configuración de entrenamiento - una tabla diferente, una iluminación diferente, un fondo diferente.

Informar las tasas de éxito en distribución y fuera de distribución por separado. Una política que alcanza el 85% en distribución pero sólo el 40% fuera de distribución tiene generalización limitada y necesita más datos de capacitación diversos o una columna vertebral más poderosa. Una política que alcanza el 80% en distribución y el 70% fuera de distribución tiene una generalización fuerte y es probable que se pueda implementar.

Evite el error común de evaluar la generalización mediante la realización de episodios aleatorios de la misma distribución que el entrenamiento. Esto mide la interpolación, no la generalización.

Taxonomía de generalización: los cuatro ejes

La generalización en el aprendizaje robótico no es una sola capacidad.

Axis What Varies Difficulty Primary Mitigation
Object generalization Color, shape, size, material within a category Moderate 15+ diverse object instances in training
Scene generalization Lighting, background, table surface, camera angle Moderate-Hard 3+ environments + aggressive augmentation
Task generalization Novel task instructions, new goal configurations Hard Language conditioning + multi-task training
Robot generalization Different robot embodiment, kinematics, gripper type Very Hard Cross-embodiment pretraining (OXE)

La mayoría de las implementaciones prácticas requieren generalización simultánea de objetos y escenarios. La generalización de tareas y robots son principalmente fronteras de investigación en 2026 - abordadas por modelos de base pero aún no lo suficientemente fiables para la producción sin ajuste fino por tarea.

Por qué las políticas no se generalizan: cambio covariado y desajuste en la distribución

La explicación matemática para el fracaso de generalización es el cambio covariado. Una política entrenada en distribución P_train se encuentra con la distribución P_deploy en el despliegue. Cuando las imágenes del entorno de despliegue activan las características de la red neuronal de manera diferente a las imágenes de entrenamiento - incluso sutilmente - las predicciones de acción de la política se vuelven poco fiables. El peligro es que este fracaso se silente: la política produce acciones confiadas que son incorrectas, sin ninguna señal interna que indique que está extrapolar.

Tres mecanismos específicos hacen que el cambio covariado sea peor en el aprendizaje robótico que en la visión por ordenador estándar:

  • Erros de composición. Un clasificador que etiqueta incorrectamente una imagen aislada tiene un error limitado. Una política que produce una acción incorrecta cambia la siguiente observación, potencialmente empujándola más lejos de la distribución de entrenamiento.
  • Enredamiento de la distribución de la acción. Las políticas aprenden no sólo "qué hacer" sino "qué hacer desde este contexto visual específico". Cuando el contexto visual cambia, incluso el concepto de la acción correcta puede cambiar (una nueva forma de objeto requiere una estrategia de captura diferente).
  • Rejimo de datos bajo. Los conjuntos de datos de robots son ordenes de magnitud más pequeños que los conjuntos de datos de visión por ordenador.

Resultados de referencia: RoboAgent y RT-2-X

Dos puntos de referencia proporcionan las mejores pruebas cuantitativas de lo que funciona en generalización a partir de 2026:

RoboAgent (Bharadhwaj et al., 2024) demostró que una única política entrenada en 12 tareas diversas con aumento agresivo de datos (aumento semántico utilizando modelos de generación de imágenes para reemplazar las texturas de objetos) logró un éxito del 68% en objetos completamente nuevos y un 55% en entornos nuevos, en comparación con el 40% y el 25% para la clonación conductual estándar. El hallazgo clave: expandir sintéticamente la diversidad visual a través de la ampliación generativa es casi tan eficaz como recopilar datos reales de entornos adicionales.

RT-2-X (del proyecto Open X-Embodiment entrenado en datos de 22 encarnaciones de robots diferentes superó las políticas de especialistas de un solo robot en aproximadamente un 50% en tareas de generalización realizadas. Esta es la evidencia más fuerte de que [la diversidad de datos (no el volumen) impulsa la generalización]

Técnicas: Aumento de datos y aleatorización de dominios

Una pila de aumentos prácticos para la formación en políticas de manipulación (estas aumentos se aplican durante la formación, no durante la recopilación de datos):

# PyTorch augmentation pipeline for robot policy training
import torchvision.transforms as T

train_transform = T.Compose([
    T.RandomResizedCrop(224, scale=(0.85, 1.0)),  # position invariance
    T.ColorJitter(
        brightness=0.3,
        contrast=0.3,
        saturation=0.3,
        hue=0.1           # conservative hue -- too much breaks object ID
    ),
    T.GaussianBlur(kernel_size=5, sigma=(0.1, 2.0)),
    T.RandomAdjustSharpness(sharpness_factor=2, p=0.3),
    T.ToTensor(),
    T.Normalize(mean=[0.485, 0.456, 0.406],
                std=[0.229, 0.224, 0.225]),
])

La mejoría esperada de esta pila de aumento: 8-15% en evaluaciones de nuevos objetos, 10-20% en evaluaciones de nuevos ambientes, con cero costo adicional de recopilación de datos.

Técnicas: Modelo de fundación de ajuste fino

La acondicionamiento de un modelo de fundación pre-entrenado (Octo, OpenVLA, pi0) es la opción arquitectónica más efectiva para mejorar la generalización en 2026. La columna vertebral pre-entrenada ha aprendido representaciones visuales de millones de imágenes que abarcan miles de categorías de objetos, condiciones de iluminación y entornos. Los datos de ajuste fino específicos de las tareas solo necesitan enseñar el mapeo de acción, no la comprensión visual.

El método de ajuste fino práctico: congelar el codificador visual durante el primer 50% de las épocas de entrenamiento (para preservar las representaciones pre-entrenadas), luego descongelar con una tasa de aprendizaje baja (1/10 de la tasa de aprendizaje de la cabeza de política) para las épocas restantes.

Resultados de generalización cuantitativa por arquitectura

La siguiente tabla recopila los resultados de los trabajos publicados y las evaluaciones del RCSV sobre un punto de referencia estandarizado de selección y ubicación (10 objetos de formación, 10 objetos de formación, 200 demostraciones de formación).

Method In-Distribution Novel Objects Novel Scene Novel Object + Scene
ACT (ResNet, no augmentation) 85% 42% 35% 22%
ACT + augmentation 83% 55% 48% 35%
ACT + DINOv2 backbone 88% 65% 55% 45%
Diffusion Policy + augmentation 86% 58% 50% 38%
Octo (fine-tuned, 200 demos) 87% 68% 58% 48%
OpenVLA (fine-tuned, 200 demos) 90% 72% 60% 52%
RoboAgent (semantic aug + 12 tasks) 88% 75% 62% 55%

Las principales ventajas: (1) el aumento de datos proporciona una mejora del 10-15% en nuevos objetos a costo cero de recogida - cada equipo debería estar utilizando. (2) las columna vertebral del modelo de base (DINOv2, Octo, OpenVLA) proporcionan otra mejora del 10-15% en la parte superior del aumento. (3) El entrenamiento multitarefa con aumento semántico (enfoque de RoboAgent) logra la mejor generalización general. (4) El eje más duro - objeto novedoso combinado con escena novedosa - se mantiene por debajo del 55% para todos los métodos, lo que subraya la dificultad fundamental del problema.

Incluir la distancia como detector OOD

Una técnica práctica para detectar cuando una observación de despliegue está fuera de distribución: calcular la distancia cosina entre la incorporación visual de la observación y el centroide de las incorporaciones de entrenamiento.

# ood_detector.py -- Detect out-of-distribution observations
import torch
import numpy as np
from scipy.spatial.distance import cosine

class OODDetector:
    """Flag observations that are far from the training distribution."""

    def __init__(self, encoder, training_embeddings, threshold_percentile=95):
        self.encoder = encoder
        # Compute centroid and distances for threshold calibration
        self.centroid = training_embeddings.mean(axis=0)
        train_distances = [cosine(e, self.centroid) for e in training_embeddings]
        self.threshold = np.percentile(train_distances, threshold_percentile)

    def is_ood(self, observation_image):
        with torch.no_grad():
            embedding = self.encoder(observation_image).cpu().numpy()
        distance = cosine(embedding, self.centroid)
        return distance > self.threshold, distance

    def get_confidence(self, observation_image):
        """Return 0-1 confidence score (1 = in-distribution)."""
        _, distance = self.is_ood(observation_image)
        return max(0.0, 1.0 - distance / (2 * self.threshold))

En la práctica, este detector capta el 70-85% de los fallos de generalización antes de que ocurran. Cuando se levanta una bandera OOD, el sistema puede pausar, solicitar orientación humana o volver a un controlador clásico conservador. Esto es especialmente valioso en las implementaciones de producción donde los fallos silenciosos son costosos.

Traslado de cuerpo a cuerpo: lo que nos enseñó OXE

El proyecto [Open X-Embodiment] (T8) proporcionó la evidencia más convincente de que la capacitación en diversos datos de robots mejora la generalización, incluso cuando el robot de despliegue no estaba en el conjunto de capacitación. RT-2-X, entrenado en datos de 22 encarnaciones de robots, mejoró la generalización de tareas nuevas en un 50% en comparación con las líneas de base de un solo robot.

El mecanismo no es que el modelo aprenda a controlar a los 22 robots simultáneamente. Más bien, el entrenamiento transversal obliga al codificador visual a aprender características que son relevantes para las tareas de manipulación en general (identidad de objeto, relaciones espaciales, compresión de las posibilidades) en lugar de características específicas del punto de vista de la cámara o la geometría del brazo de un robot. Estas características visuales de propósito general se transfieren a nuevos robots porque codifican la estructura relevante para la tarea.

Implicaciones prácticas para los equipos sin acceso a 22 robots: el ajuste fino a partir de un modelo preentrenado en cuerpo cruzado (Octo, OpenVLA) capta la mayor parte de este beneficio. El modelo pre-entrenado proporciona efectivamente la diversidad de datos "libres" de realizaciones que nunca recogieron.

Generalización espacial: Invarianza de posición y orientación

La generalización de la posición de los objetos es a menudo el primer eje de generalización en fallar y el más fácil de arreglar.

Requisitos de cobertura del espacio de trabajo. Para un espacio de trabajo típico de mesa de 40 cm x 40 cm, las demostraciones de entrenamiento deben cubrir una cuadrícula con un espacio de al menos 5 cm, es decir, al menos 64 posiciones de inicio distintas para el objeto objetivo. El protocolo de recogida del RCSV utiliza posiciones marcadas en la red para garantizar una cobertura espacial uniforme.

Diversidad de orientación. Para objetos con asimetría de rotación (herramientas, botellas con etiquetas, componentes electrónicos), incluye al menos 8 orientaciones por posición (cada 45 grados alrededor del eje vertical). El hecho de no cubrir las orientaciones es el único error de recopilación de datos más común y produce una política que funciona en orientaciones "fácil" y falla completamente en otras.

Variación de altura. Si su despliegue incluye objetos de diferentes alturas (artículos apilados, estantes), incluya variación de altura en el entrenamiento.

Generalización de los cuerpos cruzados: transferencia entre robots

Un caso especial de generalización es el despliegue de una política entrenada en una realización de robot a un robot diferente. Esta es la promesa de modelos de base como Octo y OpenVLA, y el grado en que funciona depende de la similitud entre las realizaciones de origen y objetivo.

Transfer Scenario Source Target Transferencia Zero-Shot 50-Demo Fine-Tune
Same class, same gripper WidowX 250 ViperX 300 35-50% 75-85%
Same class, different gripper Franka + parallel jaw Franka + Robotiq 2F 15-25% 65-78%
Different class, same action space Franka OpenArm 1 10-20% 60-75%
Different action space 6-DOF arm Bimanual (ALOHA) 0-5% 40-55%

** Implicaciones prácticas para los clientes de RCSV:** Si está cambiando de una plataforma de robots a otra (por ejemplo, actualizar de una WidowX a una OpenArm 1), sus datos existentes no se desperdician. El codificador visual entrenado en datos de WidowX aún proporciona una comprensión útil de objetos y escenas. Recoge 50-100 demostraciones en la nueva plataforma y ajuste la cabeza de acción mientras mantiene el codificador visual congelado. Esto generalmente recupera el 70-85% del rendimiento de la política original con una recopilación mínima de nuevos datos, en comparación con el 40-55% para el entrenamiento desde cero en las mismas demostraciones 50-100.

La clave: las representaciones visuales se transfieren bien entre las realizaciones (el codificador visual preentrenado ve los mismos objetos independientemente del robot), pero las políticas de acción se transfieren mal cuando el espacio de acción difiere. El codificador visual del entrenamiento previo a la incrustación cruzada proporciona el beneficio de generalización; la cabeza de acción debe adaptarse.

Patrones comunes de fallos y soluciones específicas

Cuando se deshacen los fallos de generalización, identificar el patrón de falla específico apunta a la solución correcta.

  • Patrón: La política se acerca pero se pierde en objetos nuevos. El codificador visual reconoce el objeto pero la estrategia de captura es incorrecta para la nueva geometría.
  • Patrón: La política ignora el objeto por completo en nuevos entornos. Las características visuales de fondo dominan y la política ha aprendido a asociar el comportamiento de la tarea con señales de fondo en lugar de características de objeto.
  • Patrón: La política funciona por la mañana pero falla por la tarde. La política es sensible a los cambios de iluminación (el ángulo de luz de la ventana cambia durante el día).
  • Patrón: La política funciona para el 80% de los objetos retrasados, pero no funciona consistentemente en los transparentes/reflectores. Los objetos transparentes y reflectores producen características visuales fundamentalmente diferentes a los objetos opacos.
  • Patrón: La política tiene éxito en el centro del espacio de trabajo pero falla en los bordes. La generalización de posiciones es limitada.

Aumento de los datos frente a la diversidad real: análisis de costes y beneficios

El aumento de datos es gratuito (sólo por el costo de cálculo). La diversidad real requiere una recopilación adicional de datos. ¿Cuándo debe aumentar vs. recopilar?

Generalización Axis Augmentation Effective? Real Diversity Needed? Recommendation
Lighting variation Yes (brightness, contrast jitter) Helpful but not required Augment first; collect in 2-3 lighting setups if augment insufficient
Object color/texture Partially (color jitter helps) Yes, for material changes Augment for color; collect for material/texture variation
Object shape/geometry No Yes, essential Collect with 15+ geometrically diverse objects
Object position Partially (random crop) Yes, for workspace coverage Collect with full workspace grid; augment for sub-grid interpolation
Background/environment Partially (background randomization) Yes, for real robustness Augment + collect in 3+ environments
Grasp strategy variation No Yes, essential Collect with diverse objects that require different grasp approaches

La regla general: la ampliación maneja la variación visual (iluminación, color, ángulo de cámara) de manera efectiva. Un conjunto de datos bien aumentado de 200 demostraciones diversas supera un conjunto de datos no aumentado de 500 demostraciones en generalización visual, pero ninguna cantidad de sustitución de aumento para la diversidad de objetos físicos.

Generalización bajo cambio de distribución: estudios de casos en el mundo real

Comprender cómo fallan las políticas en los tipos específicos de cambio de distribución ayuda a los equipos a priorizar sus estrategias de recopilación y aumento de datos.

Scenario Training Conditions Deployment Change Success Rate Drop Fix Applied
Warehouse bin picking Lab with fluorescent lighting, 15 SKUs Warehouse with skylights (variable sunlight), 50 SKUs 92% to 54% Aggressive color jitter augmentation + 100 on-site demos restored to 82%
Lab sample handling Standard test tubes, white background Colored reagent tubes, patterned rack 88% to 41% DINOv2 backbone (replacing ResNet) + 50 tube demos restored to 79%
Kitchen manipulation RCSV facility kitchen, 20 utensils Customer kitchen, different counter color, different utensil set 85% to 62% Multi-environment training (3 kitchens) during initial collection restored to 78%
Electronics assembly Rev A board design, fixed fixture Rev B board (shifted connector position by 3mm) 91% to 12% 30 new demos on Rev B + random position offset augmentation restored to 87%
Retail shelf stocking Mock shelf, 10 product types Real store shelf with price tags, adjacent products 83% to 55% Background randomization + OpenVLA fine-tune (language conditioning) restored to 76%

El patrón en estos casos: cada implementación implica un cambio de distribución. La magnitud de la caída de rendimiento depende de cuán diferentes son las condiciones de implementación de la formación, y la corrección siempre implica alguna combinación de (1) mejores representaciones visuales (espina dorsal del modelo de base), (2) aumento de datos para el eje específico de variación y (3) recopilación de datos dirigida en el lugar. Los equipos que planean la distribución cambian desde el principio - construyendo diversidad en su colección inicial - experimentan caídas más pequeñas y una recuperación más rápida.

Medición de la generalización: más allá de la tasa de éxito

La tasa de éxito binaria es la métrica de generalización estándar, pero no capta todos los aspectos de la robustez de las políticas.

  • Taxa de degradación graciosa. Cuando la política falla, ¿ha fallado de manera segura (paradas, regreso a casa) o peligrosamente (golpea objetos de la mesa, choca con obstáculos)? Una política con 70% de éxito y 25% de fracaso gracioso es más desplegable que una con 80% de éxito y 15% de fracaso peligroso.
  • Tasa de éxito de retiro. Después de un fracaso, si el sistema se reinicia y vuelve a intentar, ¿cuál es la tasa de éxito en el segundo intento?
  • ** Calibración de confianza.** Si se implementa un detector OOD (ver el enfoque de distancia de incorporación anterior), medir qué tan bien se correlaciona el puntaje de confianza con el éxito real. Un sistema bien calibrado puede marcar situaciones inciertas para revisión humana, convirtiendo los fallos de generalización en intervenciones humanas en el circuito en lugar de errores silenciosos.
  • Descendencia de la generalización con el tiempo. Rastrear la tasa de éxito semanal o mensual. La degradación gradual (cambios de iluminación con las estaciones, desgaste de hardware, variaciones de lotes de objetos) es el modo de falla de producción más común y requiere actualizaciones periódicas de datos para abordar.

Selección de modelo de fundación para la generalización máxima

Los modelos de base diferentes proporcionan diferentes perfiles de generalización. La elección depende de qué eje de generalización es más importante para su despliegue.

Modelo Fundamental Novel Object Generalización Novel Environment Generalización Language Generalización Compute Requirement
Octo (93M) Good (+20% over ACT) Moderate (+15%) Basic 1x A100 (fine-tune)
OpenVLA (7B) Strong (+30% over ACT) Strong (+25%) Strong 4x A100 (fine-tune)
ACT + DINOv2 backbone Good (+23% over ACT) Good (+20%) None 1x RTX 4090
ACT + R3M backbone Moderate (+15% over ACT) Moderate (+12%) None 1x RTX 3090

Para los equipos con computación limitada (1 GPU, RTX 3090/4090), ACT con DINOv2 proporciona la mejor generalización por dólar. Para los equipos con requisitos de acceso A100 y condicionamiento de lenguaje, el ajuste fino de OpenVLA proporciona la generalización general más fuerte. Octo ocupa el terreno medio: generalización razonable con requisitos de computación moderados. Consulte nuestra guía de video pre-entrenamiento para más detalles sobre cómo integrar estas espinas en su línea de entrenamiento.

Técnicas de aumento de datos clasificadas por impacto de generalización

El aumento de datos es la forma más barata de mejorar la generalización, pero no todas las aumentas son igualmente efectivas. Aquí hay un ranking basado en estudios de ablación RCSV en 12 tareas de manipulación de mesa.

Augmentation OOD Improvement In-Dist Impact Compute Cost Implementation Difficulty
Random crop (224 from 256) +8-15% -1 to +2% Near zero Trivial (2 lines of code)
Color jitter (brightness, contrast, saturation) +5-12% -2 to +1% Near zero Trivial
Background randomization (paste object on random bg) +10-20% -3 to 0% Low Moderate (needs segmentation mask)
Gaussian noise (sigma=0.02) +2-5% -1 to 0% Near zero Trivial
Random erasing (cutout 10-20% of image) +3-8% -2 to +1% Near zero Trivial
Spatial action perturbation (+/- 2mm noise on demo actions) +5-10% -1 to +3% Near zero Easy (add noise to action labels)

Las tres mayores ampliaciones (corte aleatorio, nerviosismo de color, aleatorización de fondo) son casi libres en costo de cálculo y se pueden combinar. Juntos, por lo general mejoran la generalización de OOD en un 15-30% con un impacto mínimo en el rendimiento en la distribución. Aplique las tres como predeterminado en cada carrera de entrenamiento. La aleatorización de fondo requiere máscaras de segmentación de objetos, que se pueden generar automáticamente utilizando SAM (Segment Anything Model) en el primer marco de cada episodio.

Aumento de acción es una técnica poco utilizada: añadir un pequeño ruido espacial (1-3 mm) a las etiquetas de acción de demostración durante el entrenamiento actúa como regulador que impide que la política recuerde trayectorias exactas.

Monitoreo de la implementación: detección de la deriva de generalización en la producción

Una vez que se implementa una política, los fallos de generalización se manifiestan gradualmente a medida que cambia el entorno de implementación.

  • Manifestar la deriva de la incorporación. Calcule la media de la incorporación de las observaciones de producción utilizando el codificador visual de su póliza y compártala con la media de la incorporación del conjunto de entrenamiento. Esto captura el cambio de distribución visual (cambios de iluminación, nuevos objetos, desalineamiento de la cámara) antes de que la tasa de éxito se degrada.
  • Rastreamiento de la tasa de éxito con control estadístico de procesos. Graba la tasa de éxito diaria en un gráfico de control con límites de control superiores e inferiores fijados en 3 desviaciones estándar de la media móvil. Este enfoque detecta las fallas repentinas (problemeos de hardware) y la degradación gradual (drift ambiental).
  • ** Categoría de fallos.** Registre los episodios fallidos con sus incrustaciones de codificadores visuales y agrupe las fallos. Si surge un nuevo agrupamiento de fallos (fallas que no coinciden con ninguna distribución de entrenamiento conocida), esto indica una nueva condición OOD. La recopilación de datos dirigida para ese modo de fallos específico (10-30 demos) suele ser suficiente para corregir la brecha sin una reentrenamiento completo.
  • Reevaluación periódica. Realice el protocolo de evaluación de generalización completo (objetos retenidos, condiciones retenidas) mensualmente. Compara los resultados con el nivel de base previo a la implementación. Una caída de más del 5% en cualquier eje desencadena un ciclo de actualización de datos. Presupuesto de 2-4 horas al mes para esta reevaluación.

Una estrategia práctica de generalización para 2026

Para los equipos que construyen políticas de manipulación en 2026, aquí está el enfoque que produce consistentemente los mejores resultados de generalización:

  1. ** Comience con una columna vertebral del modelo de base.** Utilice un codificador visual pre-entrenado en video o VLM (DINOv2, SigLIP o R3M) como columna vertebral visual de su póliza. Esto proporciona una amplia generalización visual desde el primer día.
  2. Recolectar demostraciones diversas, no grandes. 200 demostraciones en 15 instancias de objetos, 3 configuraciones de iluminación y 3 operadores generalizarán mejor que 2.000 demostraciones con un solo objeto.
  3. Usa el condicionamiento del lenguaje. Si tu implementación requiere alguna variación de tarea, condicione la política de instrucciones de lenguaje.
  4. Augmentar agresivamente. Aplicar el nerviosismo de color, cultivos aleatorios, variación de brillo y aumento de fondo durante el entrenamiento.
  5. Mejore la generalización explícitamente. Determine los objetos y condiciones. Reporte las métricas de OOD. No envíe una póliza cuya generalización no haya medido.

Lista de control de evaluación de generalización

  • Reserva de 5 a 10 instancias de objetos por categoría que nunca se utilizan durante el entrenamiento
  • Prueba en 3+ puestos de trabajo no incluidos en la distribución de la formación
  • Evaluar en al menos 2 condiciones de iluminación no observadas durante la formación
  • Realizar un mínimo de 20 ensayos de evaluación por condición para la importancia estadística
  • Informar por separado las tasas de éxito en la distribución y en la salida de la distribución
  • Generalización de la pista por eje (objeto, posición, iluminación) de forma independiente
  • Documenta el conjunto exacto retido para que los resultados sean reproducibles
  • Definir los umbrales de aprobación/fallo antes de ejecutar las evaluaciones, no después

Protocolo de prueba de generalización: plantilla completa

Utilice esta plantilla para ejecutar una evaluación de generalización estandarizada en cualquier política de manipulación entrenada.

  1. Define la matriz de ensayo. Crea una cuadrícula de condiciones de evaluación: 5 objetos en distribución x 3 posiciones en distribución = 15 condiciones en distribución. 5 objetos en suspensión x 3 posiciones en suspensión = 15 condiciones OOD. 2 condiciones alternativas de iluminación x 5 objetos = 10 condiciones de cambio de iluminación. Total: 40 condiciones.
  2. Run 3 ensayos por condición. Ejecutar la política bajo cada condición 3 veces. Registrar el éxito/fallo, el tiempo de finalización y cualquier intervención necesaria. Total: 120 ensayos (aproximadamente 2-3 horas a 1-2 minutos por ensayo incluyendo el restablecimiento).
  3. Métricas de cálculo. Taxa de éxito en la distribución (taxa de éxito media y 95% de CI sobre 45 ensayos). Taxa de éxito de OOD (taxa de éxito media y 95% de CI sobre 45 ensayos). Robustez de la iluminación (reducción de la tasa de éxito desde la línea de base a la iluminación alternativa).
  4. Formático de informe. Reporte las cuatro métricas con intervalos de confianza. Una brecha de generalización inferior al 15% indica una buena generalización.

Los [servicios de datos] de RCSV (T10) incorporan requisitos de diversidad en cada protocolo de recogida. Nuestros paquetes de recogida estándar ($ 2.500 piloto / $ 8.000 campaña) incluyen multi-objeto, multi-ambiente, diversidad multi-operador por defecto, y nuestra línea de evaluación incluye pruebas de generalización prolongadas. Para obtener ayuda en la construcción de un conjunto de datos diseñado para su generalización o para apoyar la evaluación de una política capacitada, [contacte al equipo del RCSV]

Lectura relacionada

Dep Dive: The Generalización Challenge · Open X-Embodiment Dataset · Leyes de escala para el aprendizaje de robots · Tips de transferencia de Sim a Realidad · Aprendizaje desde el vídeo · Guía de aprendizaje de imitación · Servicios de datos

Construye políticas generalizadas

Los protocolos de recopilación de datos del RCSV están diseñados en torno a objetivos de diversidad que maximizan la generalización. Nuestros paquetes estándar ($ 2.500 piloto / $ 8.000 campaña) incluyen multi-objeto, multi-ambiente, diversidad multi-operador, y nuestra línea de evaluación incluye pruebas de generalización prolongadas en nuevos objetos y condiciones.

[Discutir sus requisitos de generalización]