Volver a Blog

Aprendizaje de robots desde video: estado de la técnica en 2026

Encuesta completa del aprendizaje de robots a partir del video en 2026: pre-entrenamiento visual (R3M, MVP), modelos de video-linguego-acción, qué funciona y qué no y implicaciones prácticas para la recopilación de datos.

[← Blog] T4)

Hay miles de millones de horas de videos de manipulación humana en Internet. La promesa de usar esos datos para enseñar a los robots es real, pero el mecanismo que realmente funciona es diferente de lo que la mayoría de la gente espera, y la brecha entre lo que el video proporciona y lo que los robots necesitan sigue siendo significativa.

Por qué el video es tan atractivo para el aprendizaje de los robots

El llamamiento es aritmético. Recopilar datos de demostración de robots a través de [teleoperatoria] (T5) produce de 30 a 120 episodios por hora. Un equipo de investigación con una estación de robots que funciona 8 horas al día recoge aproximadamente 500 a 1,000 episodios por día. Mientras tanto, solo YouTube recibe más de 500 horas de video cada minuto. Tutoriales de cocina, demostraciones de carpintería, imágenes de montaje de fábrica, procedimientos quirúrgicos -- Internet contiene demostraciones de esencialmente todas las tareas físicas que se le podría pedir a un robot para realizar, a una escala que la recopilación de datos nativos del robot no puede igualar.

Si los robots pudieran aprender directamente de este video, el cuello de botella de datos que limita la IA física desaparecería en gran medida. En lugar de pasar meses recopilando demostraciones específicas de tareas en hardware específico, los equipos podrían simplemente apuntar sus modelos al subconjunto relevante del video de Internet y entrenar políticas de manipulación de propósito general.

La realidad, a partir de 2026, es más matizada. El video ha demostrado ser enormemente útil para el aprendizaje de robots, pero no de la manera que sugiere la sencilla narrativa. El camino desde el video al comportamiento de los robots pasa por enfoques técnicos específicos, cada uno con fuertes y limitantes.

Los tres problemas fundamentales

** Las acciones no están etiquetadas.** El video muestra lo que sucede - una mano se extiende a una taza, la levanta, derrama agua - pero no registra los comandos motores que producen esos movimientos. Una política del robot necesita mapear las observaciones a las acciones: velocidades conjuntas, desplazamientos de los efectores finales, comandos de agarre. El video proporciona el lado de observación pero no el lado de acción. Recuperar acciones de vídeo requiere resolver un problema inverso que es fundamentalmente subdeterminado.

** Desajuste de cuerpo.** Las manos humanas tienen 27 grados de libertad, piel compatible que proporciona una rica retroalimentación táctil y capacidades de fuerza que difieren dramáticamente de las agarradoras robóticas. Incluso si pudieras extraer etiquetas de acción perfectas de video, esas acciones describen comandos motores humanos, no comandos motores robots.

Desajuste de puntos de vista. El video humano se capta desde perspectivas de primera persona (egocéntricas) o de tercera persona que rara vez coinciden con las colocaciones de las cámaras robóticas. Un robot típicamente tiene una cámara de muñeca y una o más cámaras aéreas fijas. Las características visuales aprendidas del video de perspectiva humana pueden no activarse correctamente en las observaciones de perspectiva robótica, limitando la transferencia directa de políticas visuales.

Lo que realmente funciona: Preentrenamiento de representación visual

El resultado más fuerte validado del aprendizaje de robots basado en video es el pre-entrenamiento de representación visual. El enfoque: entrenar un codificador visual en grandes cantidades de video manipulado por humanos - sin etiquetas de acción - y luego usar las representaciones resultantes para iniciar la columna vertebral visual de una red de políticas de robots. Esto mejora constantemente la eficiencia de la muestra para el aprendizaje de robots en aguas subidas en un 15 a 40 por ciento.

R3M (Nair et al., 2022) preparó un ResNet en el conjunto de datos Ego4D de vídeo humano egocéntrico de Meta utilizando un objetivo de aprendizaje contrastivo en el tiempo combinado con la alineación del lenguaje. El codificador visual resultante, cuando se usa para iniciar las políticas de manipulación de Franka, mejora la eficiencia de la muestra en un 15-40% en comparación con el pre-entrenamiento de ImageNet en múltiples tareas de referencia. R3M sigue siendo uno de los codificadores de vídeo pre-entrenados más utilizados en la investigación del aprendizaje robótico.

MVP (Masked Visual Preentrenamiento, Xiao et al., 2022) utilizó autoencodificación enmascarada en una combinación de video egocéntrico y datos de ImageNet. Las representaciones aprendidas se transfirieron bien a tareas de control de robots, demostrando que la auto-supervisión pre-entrenamiento en videos relevantes para la manipulación superó las funciones de ImageNet para el aprendizaje de políticas de robots.

SPA (Zhu et al., 2024) amplió el paradigma de pre-entrenamiento con objetivos de conciencia espacial, produciendo representaciones con un mejor razonamiento espacial 3D. SPA mostró un rendimiento de robot en aguas posteriores comparable o mejor que R3M mientras proporcionaba características espaciales más interpretables.

El mecanismo detrás de estos resultados es bien entendido: el video de manipulación humana contiene enormes cantidades de información sobre las capacidades de los objetos, cómo se ven los objetos, cómo se mueven cuando se empujan o se apretan, qué constituye una configuración estable. Incluso sin etiquetas de acción explícitas, esta información se codifica en las características visuales y se transfiere directamente a la percepción del robot. Un codificador visual que ha visto miles de horas de humanos agarrando copas sabe cómo se ve una copa agarrable, que es exactamente la representación que necesita un robot agarrando políticas.

Modelos de acción en video: La nueva frontera

La aparición de modelos de lenguaje de visión (VLM) ha abierto un nuevo camino para la transferencia de video a robot. Los modelos de video-lenguaje-acción (VLA) combinan codificadores visuales entrenados por video con comprensión del lenguaje y predicción de la acción en una sola arquitectura. La clave: el lenguaje proporciona un puente entre el contenido semántico del video y las acciones específicas que un robot necesita ejecutar.

RT-2 (Brohan et al., 2023) demostró que un VLM pre-entrenado en datos de imagen y texto a escala de Internet podría ser ajustado para producir acciones de robots directamente. RT-2 mostró una generalización significativa de disparos cero a nuevos objetos e instrucciones no vistas durante la recopilación de datos del robot.

SuSIE (Black et al., 2023) utilizó un modelo de generación de video como generador de subobjetivos: dada una observación actual y una instrucción de idioma, genera una imagen futura plausible que muestra el estado de objetivo, luego una política de bajo nivel ejecuta acciones para alcanzar ese subobjetivos generados. Este enfoque aprovecha las capacidades de predicción de video -- entrenadas en video de Internet -- para proporcionar planificación visual para robots.

UniSim (Yang et al., 2023) fue más allá, entrenando un simulador universal a partir de datos de video que podría predecir cómo el mundo visual evoluciona en respuesta a las acciones. Este modelo de mundo aprendido permite el control predictivo de modelo: el robot imagina las consecuencias de las acciones candidatas ejecutándolas a través del modelo de predicción de video y selecciona la secuencia de acción con el mejor resultado predicho.

Estos enfoques representan un progreso genuino, pero tienen importantes limitaciones. Los modelos VLA requieren datos de ajuste fino sustanciales específicos de los robots para producir acciones confiables. El video pre-entrenamiento proporciona comprensión visual y conexión a tierra semántica, no un control motor preciso. SuSIE y UniSim trabajan en entornos estructurados, pero aún no son lo suficientemente robustos para el despliegue de producción en tareas de precisión.

Lo que aún no funciona: Aprender directamente políticas desde videos de Internet

El sueño de entrenar una política de robots de extremo a extremo en video de Internet -sin datos de robots en absoluto- sigue sin realizarse en 2026. Varias direcciones de investigación han intentado esto:

  • Los modelos de dinámica inversa intentan etiquetar el video con pseudoacciones prediciendo la acción entre los cuadros consecutivos. Esto requiere resolver la estimación de la posición humana a una precisión subcentimetral, retargeting los ángulos articulares humanos a la cinemática robótica y manejar la brecha de la encarnación. Las tuberías de retargeting actuales funcionan para los movimientos brutales de los brazos pero fallan para la manipulación del dedo fino que es más valiosa para el aprendizaje del robot.
  • DMP trajectory fitting extrae trajectorias de la mano de los videos utilizando la estimación de la postura y se ajusta a los movimientos primarios dinámicos a ellos. Esto transfiere movimientos de alcance gruesos pero no logra la captura, inserción o cualquier tarea de precisión donde la dinámica de contacto es importante.
  • Las políticas directas con videocondicionado que toman una demostración de video como entrada y producen acciones de robots han mostrado ser prometedoras en tareas simples en configuraciones controladas, pero aún no manejan los puntos de vista, la realización y las lagunas físicas con suficiente robustez para el despliegue general.

El problema fundamental es que el video carece de la señal de supervisión de acción que las políticas de robots necesitan. Las representaciones visuales se transfieren bien porque la percepción es en gran medida independiente de la encarnación - una taza se parece a una taza independientemente de si un humano o un robot la está mirando. Pero el control motor es profundamente dependiente de la encarnación, y el video no contiene la información necesaria para cerrar esa brecha.

Comparar los modelos de formación previo a la visión

La siguiente tabla compara los principales codificadores visuales pre-entrenados en video disponibles para la inicialización de políticas de robots a principios de 2026.

Model Preentrenamiento Data Backbone Eficiencia de Muestreo Gain Novel Object Improvement Params
R3M Ego4D (egocentric video) ResNet-50 15-40% +12-18% 25M
MVP Ego4D + ImageNet ViT-B/16 20-35% +10-16% 86M
SPA Ego4D + spatial tasks ViT-B/16 25-40% +14-20% 86M
DINOv2 LVD-142M (curated images) ViT-L/14 20-35% +15-25% 300M
SigLIP WebLI (image-text pairs) ViT-L/16 15-30% +12-22% 300M
VC-1 Ego4D + ImageNet + robot video ViT-L/16 25-45% +15-22% 300M
ImageNet ResNet (baseline) ImageNet-1K (classification) ResNet-50 Baseline (0%) Baseline (0%) 25M

Los resultados clave: DINOv2 y VC-1 proporcionan los resultados generales más fuertes en 2026, pero también son los modelos más grandes (300M parámetros), lo que afecta la velocidad de inferencia. R3M sigue siendo una fuerte opción cuando la latencia de inferencia importa (25M parámetros, se ejecuta en CPU). SPA proporciona el mejor razonamiento espacial, lo que importa para tareas de colocación precisas. SigLIP proporciona alineación de lenguaje que es útil si planea ajustar a una línea de VLA más tarde.

Guía para ajustar el tono: desde un codificador pre-entrenado hasta una política de robots

La integración de un codificador pre-entrenado en video en su línea de capacitación política requiere decisiones cuidadosas sobre cuánto del codificador congelar, cómo combinarlo con predicción de acción y cómo gestionar el horario de tasa de aprendizaje.

** Paso 1: Elige tu codificador.** Para la mayoría de las tareas de manipulación de mesa, DINOv2 ViT-B/14 (86M parámetros) proporciona la mejor compensación entre la calidad de representación y la velocidad de inferencia. Para aplicaciones sensibles a la latencia (> control de 20 Hz), utilice R3M ResNet-50 (25M parámetros).

** Paso 2: Decide qué congelar.** Tres estrategias, clasificadas desde la más conservadora a la menos conservadora:

  • Congela todas las capas de codificación. Utilice el codificador pre-entrenado como extractor de características fijas. Entrenar solo la cabeza de política (red de predicción de acción) en sus datos de tarea. Esto funciona mejor cuando tiene menos de 100 demostraciones. Tiempo de entrenamiento: 1-2 horas en una sola GPU.
  • _Congela las primeras capas, ajusta las últimas capas._Congela el 75% del codificador (que capta características visuales generales) y ajusta el 25% final junto con la cabeza de política. Esto permite que el codificador se adapte a su punto de vista y iluminación específica de la cámara mientras se conserva un amplio conocimiento visual. Ideal para 100-500 demostraciones.
  • Fine-tune everything with low learning rate. Entrenar todo el modelo con una tasa de aprendizaje 10-100 veces menor para el codificador que para el jefe de política (por ejemplo, codificador LR = 1e-6, jefe de política LR = 1e-4).

** Paso 3: Manejar la discrepancia de resolución.** La mayoría de los codificadores pre-entrenados esperan 224x224 o 384x384 entradas. Las cámaras robóticas a menudo capturan a una resolución más alta (640x480, 1280x720). Redimensionar entradas para que coincidan con la resolución esperada del codificador. No cambie el tamaño del parche del codificador o la codificación posicional - esto descarta la información pre-entrenada. Si su tarea requiere detalles de alta resolución (por ejemplo, leer texto pequeño en paquetes), considere extraer características de múltiples cultivos en lugar de reducir la escala.

# Example: Using DINOv2 as a frozen encoder for ACT-style policy
import torch
from transformers import AutoModel, AutoImageProcessor

# Load pre-trained DINOv2
encoder = AutoModel.from_pretrained("facebook/dinov2-base")
processor = AutoImageProcessor.from_pretrained("facebook/dinov2-base")

# Freeze encoder weights
for param in encoder.parameters():
    param.requires_grad = False

# Extract features from a robot camera image
image = camera.capture_rgb()  # (480, 640, 3) numpy array
inputs = processor(images=image, return_tensors="pt")
with torch.no_grad():
    features = encoder(**inputs).last_hidden_state  # (1, 257, 768)
    cls_token = features[:, 0, :]  # (1, 768) -- global image feature

# Feed cls_token + proprioception to your action prediction head
obs = torch.cat([cls_token, joint_state], dim=-1)  # (1, 768+7)
action = policy_head(obs)  # (1, chunk_size, action_dim)

Indicadores de representación: ¿Qué codificador para qué tarea?

No todos los codificadores pre-entrenados funcionan de manera igual en todos los tipos de tareas. Basándose en ablaciones publicadas y evaluaciones internas de RCSV, aquí están las recomendaciones específicas de las tareas:

  • Pic-and-place (objetos rígidos): DINOv2 ViT-B proporciona el rendimiento más fuerte.
  • ** Manipulación de objetos deformables (telas, alimentos):** R3M o VC-1 superan a DINOv2 en tareas deformables porque el objetivo de contraste temporal en el entrenamiento previo a la video capta la dinámica de objetos que la formación previo a la imagen estática no logra.
  • ** Manipulación con condiciones de lenguaje:** SigLIP proporciona la transferencia más fuerte porque la alineación pre-entrenada del lenguaje-visión ayuda a las instrucciones de base de la lengua política en las características visuales.
  • Tarea de inserción rica en contactos: Todos los codificadores visuales proporcionan un beneficio mínimo (< 10% de mejora) porque estas tareas son dominadas por la retroalimentación propioceptiva y de la fuerza, no por las características visuales. Considere agregar datos [sensor de torque de fuerza]T6) en lugar de un codificador visual más grande.
  • ** Generalización multi-ambiente:** DINOv2 y VC-1 proporcionan la mayor mejora de OOD (20-30%) porque sus diversos datos pre-entrenamiento incluyen una amplia variedad visual.

Integración de la tubería de datos: desde el codificador de vídeo hasta la formación en políticas

La integración de un codificador de vídeo pre-entrenado en una pipeline de aprendizaje de imitación existente requiere modificaciones específicas de procesamiento de datos y entrenamiento.

# video_encoder_pipeline.py -- Integrate pre-trained encoder into IL training
import torch
from torchvision import transforms

class VideoPretrainedPipeline:
    """Pipeline for using video-pretrained encoders in IL training."""

    def __init__(self, encoder_name="dinov2_vitb14", freeze=True):
        self.encoder = torch.hub.load('facebookresearch/dinov2', encoder_name)
        self.freeze = freeze
        if freeze:
            for param in self.encoder.parameters():
                param.requires_grad = False

        # Normalization must match pre-training distribution
        self.transform = transforms.Compose([
            transforms.Resize(224),
            transforms.CenterCrop(224),
            transforms.Normalize(
                mean=[0.485, 0.456, 0.406],
                std=[0.229, 0.224, 0.225]),
        ])

    def extract_features(self, image_tensor):
        """Extract features from a single camera image.
        Args: image_tensor: (B, 3, H, W) in [0, 1]
        Returns: (B, 768) feature vector for ViT-B
        """
        x = self.transform(image_tensor)
        with torch.no_grad() if self.freeze else torch.enable_grad():
            features = self.encoder(x)  # CLS token: (B, 768)
        return features

    def build_observation(self, image, proprioception):
        """Combine visual and proprioceptive features.
        Args:
            image: (B, 3, H, W) camera image
            proprioception: (B, D) joint angles, gripper state
        Returns: (B, 768 + D) combined observation
        """
        vis_features = self.extract_features(image)
        return torch.cat([vis_features, proprioception], dim=-1)

** Detalle crítico de la implementación:** Los parámetros de normalización (media, std) deben coincidir exactamente con los valores utilizados durante el entrenamiento previo del codificador. El uso de normalización incorrecta degrada el rendimiento en un 10-30% porque el codificador recibe entradas fuera de distribución. DINOv2 y R3M utilizan valores de normalización ImageNet. SigLIP utiliza una normalización diferente - comprobar la tarjeta modelo antes de integrar.

Para configuraciones de múltiples cámaras, instanciar un codificador por vista de cámara o compartir un único codificador en todas las vistas (compartición de peso). Se prefiere compartir peso: reduce el uso de memoria y produce espacios de características más consistentes en todas las vistas.

Documentos y sistemas notables que hay que conocer

Para los equipos que se basan en el aprendizaje de robots basado en video, estas son las referencias clave a principios de 2026:

  • R3M (Meta, 2022): Pre-entrenamiento de vídeo egocéntrico para representaciones de manipulación de robots. La línea de base para superar para el pre-entrenamiento visual.
  • MVP (2022): Pre-entrenamiento visual enmascarado que combina datos de video e imagen.
  • SuSIE (2023): Generación de video como subobjetivos de planificación para la manipulación de robots. Demostrar cómo los modelos de predicción de video pueden guiar el comportamiento de los robots.
  • UniSim (2023): simulador universal aprendido de video. Muestra que los modelos mundiales entrenados en video pueden soportar el control predictivo de modelos.
  • RT-2 (Google DeepMind, 2023): Modelo de lenguaje de visión afinado para las acciones de los robots. Estableció el paradigma VLA que domina la investigación actual.
  • GR-2 (ByteDance, 2024): Modelo de generación de vídeo adaptado para el aprendizaje de políticas robóticas, ampliando el enfoque SuSIE a mayor escala.
  • ** Octo** (2024): Política generalista de robots de código abierto con la columna vertebral visual pre-entrenada por video. punto de partida práctico para los equipos que deseen construir sobre arquitecturas VLA.

Las limitaciones actuales: lo que el video no puede enseñar a los robots

Comprender los límites difíciles del aprendizaje basado en video evita que los equipos inviertan en exceso en enfoques que no funcionen para sus tareas específicas.

  • ** Modulación de fuerza.** El video no proporciona información sobre la fuerza de agarre, la fuerza de inserción o la presión de contacto. Un humano que derrama agua de una jarra ajusta la fuerza de agarre en función del cambio de peso, el par de muñeca y la dinámica del flujo líquido, ninguno de los cuales se puede recuperar del video. Las políticas para tareas sensibles a la fuerza requieren demostraciones nativas de robots con sensor de torque de fuerza.
  • Loops de retroalimentación propiocceptiva. Los humanos realizan muchas tareas de manipulación con los ojos cerrados después de la guía visual inicial - el control motor es propiocceptivo. El video captura solo el resultado visual, no el ciclo de control propiocceptivo. Las tareas que dependen de la retroalimentación del par articulado, la detección de contacto táctil o la memoria cinestética (inserción ciega, apretamiento de un tornillo a un par objetivo) no ganan nada con el entrenamiento previo al video.
  • ** Perfiles de tiempo y velocidad.** Las velocidades de fotogramas de vídeo (típicamente 24-30 fps) subestiman la dinámica temporal de las tareas de manipulación rápida. Un ciclo rápido de pick-and-place que dura 0,8 segundos se extiende a solo 20-24 fotogramas a 30 fps - una resolución temporal insuficiente para aprender los perfiles de velocidad y aceleración que distinguen un movimiento experto suave de un novato sin movimiento.
  • Tempo de coordinación bimanual. Para [tareas bimanual] ((T8), el tiempo preciso de coordinación del brazo izquierdo-derecho es crítico y no se puede recuperar del video.

Lista de verificación de la implementación de los programas de formación previa

Para los equipos que estén listos para integrar la pre-entrenamiento de vídeo en su línea de trabajo, siga esta lista práctica:

  1. ** Seleccione un codificador basado en su tipo de tarea** (ver Benchmarks de representación arriba). Recomendación por defecto: DINOv2 ViT-B para la manipulación general; R3M para aplicaciones sensibles a la latencia.
  2. Descargar pesas pre-entrenadas. Todos los codificadores recomendados están disponibles en Hugging Face: T2, T3, o en los repositorios originales de papel.
  3. Combina la resolución de entrada. Redimensionar las imágenes de la cámara robot para que coincidan con la entrada esperada del codificador (224x224 para la mayoría de los modelos ViT, 224x224 para R3M ResNet).
  4. Bencmark congelado vs. codificador afinado. Comience con codificador congelado (más rápido, más seguro). Si el rendimiento es insuficiente después de más de 50 demostraciones, cambie a un ajuste parcial de las últimas 25% de las capas.
  5. ** Calidad de las características de monitoreo.** Visualice los mapas de atención (ViT) o los mapas de activación (ResNet) del codificador en las imágenes de su cámara robot. Si el codificador se ocupa principalmente de fondo en lugar de objetos relevantes para la tarea, no proporciona características útiles y es posible que necesite una fuente de pre-entrenamiento diferente o ajustes más agresivos.
  6. Corre la ablación controlada. Siempre compare con la línea de base de ImageNet para cuantificar el beneficio real para su tarea específica antes de comprometerse con una tubería más compleja.

Implicaciones prácticas para los equipos que recopilan datos

Dada la situación en el campo en 2026, esto es lo que la investigación implica para los equipos que toman decisiones sobre la recopilación de datos:

Use codificadores visuales entrenados por video. Inicia la columna vertebral visual de su póliza con R3M, SPA, MVP o un Transformador de visión entrenado por video en lugar de pesas de ImageNet. Esta es una mejora gratuita de la eficiencia de la muestra del 15-30% que no requiere recopilación de datos adicionales.

Seguimos recogiendo demostraciones nativas de robots para el aprendizaje de acción. El video proporciona la representación visual; la teleoperatriz robótica proporciona los datos de entrenamiento etiquetados por acción. Estos son complementarios, no alternativas. Un equipo que invierte en la recopilación de datos de teleoperatriz de alta calidad y utiliza codificadores de video pre-entrenados superará a un equipo que depende exclusivamente de cualquiera de los dos enfoques.

Combina el pre-entrenamiento de video con el aumento de datos. Los codificadores pre-entrenados por video y el aumento de datos son complementarios, no sustitutos. El pre-entrenamiento de video proporciona representaciones visuales generales; el aumento de datos hace que esas representaciones sean robustas para variaciones específicas de implementación. Aplique el nerviosismo de color, el recorte aleatorio y el aumento de brillo incluso cuando use un codificador pre-entrenado por video. En ablaciones RCSV, la combinación de DINOv2 pre-entrenamiento más el aumento estándar mejora la tasa de éxito de OOD en 25-35% sobre la línea de base de ImageNet sin aumento - más de lo que proporciona cualquiera de las técnicas por sí sola (15-20% cada uno).

Use instrucciones de lenguaje en su recopilación de datos. El paradigma de VLA se basa en el comportamiento condicionado por el lenguaje. Si recoge demostraciones con instrucciones de lenguaje natural asociadas ("coge la taza roja", "coloca el perno en el agujero"), sus datos son directamente compatibles con las tuberías de ajuste fino de VLA que aprovechan la alineación visual-lingüística entrenada por video. Si recolectas demostraciones sin etiquetas de lenguaje, pierdes esta conexión.

Considere la curaduría de vídeo específica de dominio. Si su dominio objetivo tiene abundante video - como cocinar, empacar o montar electrónica - curar un conjunto de datos de vídeo específico de dominio para el pre-entrenamiento de su codificador visual puede superar el pre-entrenamiento genérico. Las características visuales aprendidas de los videos de cocina son más relevantes para las tareas de manipulación de cocina que las características aprendidas de los vídeos genéricos de Internet.

Funalidades de codificación precomputación y caché. Para conjuntos de datos menores a 1.000 episodios, precompute las características de codificación visual para cada fotograma y almacenalas junto a las imágenes crudas. Esto elimina el pase del codificador hacia adelante durante el entrenamiento (ahorrá 50-80% del tiempo de entrenamiento para codificadores congelados) y permite una rápida iteración en las arquitecturas de predicción de acción sin volver a ejecutar el codificador visual. Los archivos de caché son típicamente de 10-50 MB por episodio para las características ViT-B (768 dimensiones por fotograma a 30 fps durante 30 segundos).

No esperes que el entrenamiento solo con video funcione. La brecha entre los enfoques de video y de datos con video y robots sigue siendo grande. Los equipos que retrasan la recopilación de datos esperando que los métodos solo con video maduren están cometiendo un error estratégico. Recoge ahora datos reales con robots, utilice el entrenamiento previo con video para amplificar su valor e incorpore mejores métodos basados en video a medida que estén disponibles.

Evaluando prácticamente: Cómo medir el beneficio de los videos pre-entrenamientos

Los equipos que adoptan la formación previa a la video deben medir rigurosamente su impacto en lugar de asumir que ayuda.

  • ** Ablación controlada:** Entrenar dos arquitecturas de políticas idénticas en sus datos de tarea - una con una columna vertebral visual pre-entrenada por video (R3M, SPA o DINOv2), otra con una columna vertebral pre-entrenada por ImageNet. Evalúe en el mismo conjunto de pruebas realizadas. La diferencia en la tasa de éxito es el beneficio atribuible de la pre-entrenamiento de video para su tarea específica.
  • Curva de eficiencia de muestra: Entrenar ambas variantes en 25%, 50%, 75% y 100% de sus datos de capacitación.
  • Evaluación OOD: Prueba ambas variantes en objetos y entornos retenidos. Los codificadores de vídeo pre-entrenados suelen mostrar su mayor ventaja en la evaluación fuera de distribución (15-30% mejoría en objetos nuevos) en lugar de la evaluación dentro de la distribución (5-15% mejoría).

Resultados esperados basados en evaluaciones internas publicadas y RCSV: para las tareas de manipulación de mesa con 100-300 demostraciones, el entrenamiento previo a video proporciona una mejora de la eficiencia de la muestra del 15-25% (lo que significa que se necesitan 15-25% menos demostraciones para alcanzar el mismo rendimiento) y una mejora absoluta del 10-20% en la generalización de nuevos objetos. Para las tareas con datos abundantes (1.000+ demostraciones), la mejora se reduce al 5-10%.

La brecha en el cuerpo: por qué las acciones de video no se transfieren directamente

La brecha de realización es la razón fundamental por la que el aprendizaje directo de políticas a partir del vídeo de Internet sigue sin realizarse.

** Desajuste cinematográfico.** Un brazo humano tiene 7 DOF principales ( hombro 3, codor 1, muñeca 3) más 27 DOF en la mano. Un brazo robótico típico tiene 6-7 DOF con un agarre paralelo de mandíbula de 1 DOF. La misma tarea ejecutada por un humano y un robot utiliza trayectorias articulares fundamentalmente diferentes porque la estructura cinemática difiere. Incluso el seguimiento perfecto de la mano humana no produce trayectorias que un robot puede ejecutar.

** Desajuste de estrategia de agarre.** Los humanos utilizan agarradas de punta de dedo, agarradas de potencia, agarradas de pincha y docenas de otras configuraciones de la mano de forma intercambiable. Un agarre paralelo de mandíbula tiene exactamente un modo de agarre: cierra las mandíbulas.

Desajuste de fuerza y cumplimiento. La manipulación humana depende en gran medida de la conformidad natural de la piel y el tejido muscular, lo que proporciona una adaptación pasiva de la fuerza. Las agarradas de los robots son rígidas (o tienen una composición limitada, diseñada). Un humano toma una taza de papel con un apretón suave que se ajusta automáticamente a la complimiento de la taza. Un robot necesita un control explícito de la fuerza para lograr el mismo efecto, y ninguna cantidad de datos de video enseña al robot sobre su propia dinámica de fuerza.

Implicaciones de la escala. Estas discrepancias significan que el video proporciona un conocimiento útil de representación visual (cómo se ven los objetos, dónde se encuentran, qué prestaciones tienen) pero no un conocimiento útil de control motor (cómo mover las articulaciones, cuánto fuerza aplicar, cómo coordinar el tiempo). El límite práctico de la contribución del video al aprendizaje robótico se establece por esta división: el video ayuda con el "qué" y "dónde" de la manipulación, pero no con el "cómo".

Fusión de vídeo multi-cámara para el aprendizaje del robot

Un área de investigación en crecimiento en 2026 está utilizando múltiples puntos de vista de vídeo simultáneamente para mejorar el aprendizaje de los robots. Mientras que la mayoría de los pre-entrenamientos de video utilizan datos de un solo punto de vista, los robots en la práctica tienen múltiples cámaras (muñeca, cabeza superior, lateral). El reto es alinear las representaciones a través de estos puntos de vista para que las características pre-entrenadas sigan siendo útiles independientemente de la colocación de la cámara.

** Aprendizaje de contraste de visión transversal** capacita a un codificador para producir embebedimientos similares para diferentes vistas de la misma escena de la cámara. Esto es particularmente efectivo cuando se combina con la formación previa de vídeo: pre-entrenamiento en video de Internet de vista única para características visuales generales, luego ajuste fino con un objetivo de contraste de visión transversal en datos de robots de múltiples cámaras. El resultado es un codificador visual que transfiere conocimiento visual a escala de Internet mientras que es robusto a la disposición específica de la cámara en su robot.

Camera Configuration Typical Resolution Frame Rate Primary Use for Policy Video Preentrenamiento Benefit
Overhead (third-person) 640x480 30 fps Spatial layout, object positions High (matches internet video perspectives)
Wrist-mounted (eye-in-hand) 640x480 30 fps Grasp precision, contact detection Moderate (egocentric video data helps)
Side-angle (45-degree) 640x480 30 fps Depth disambiguation, approach angle High (common in cooking/tutorial videos)
Depth camera (RealSense) 640x480 + depth 30 fps 3D geometry, height estimation Low (no depth in internet video)

Guía práctica: utilice su cámara aérea con el codificador pre-entrenado de vídeo (el mayor beneficio) y procesar la cámara de muñeca con un codificador separado, más pequeño o con una versión de ajuste fino del mismo codificador. Este enfoque de doble codificación agrega una latencia mínima (pasos paralelos hacia adelante) al tiempo que maximiza el beneficio de la pre-entrenamiento de vídeo en la vista de la cámara donde más ayuda.

Curar video específico de dominio: un protocolo paso a paso

Para los equipos cuyo dominio de implementación tiene abundante video de Internet (cocina, empaquetado, ensamblaje de electrónica, trabajo de laboratorio), curar un conjunto de datos de video específico para el entrenamiento previo al codificador puede superar los modelos genéricos en un 10-15%. Aquí está el protocolo que RCSV utiliza para la curadoria de video específica de dominio.

  1. Define categorías de videos relevantes para la tarea. Para un despliegue de manipulación de cocina, las categorías relevantes incluyen: tutoriales de cocina, preparación de alimentos, limpieza de cocina, carga de lavadoras de platos, desempaqueo de comestibles. Sé específico - "cocina" es demasiado amplio; "cortando verduras en una tabla de corte" es la granularidad correcta.
  2. ** Fuente de vídeo de YouTube, Ego4D y plataformas específicas de dominio.** Utilice yt-dlp para descargar listas de reproducción relevantes (garantizar el cumplimiento de las licencias). Para Ego4D, filtre por etiqueta de actividad. Objetivo 500-2,000 horas de video específico de dominio. Más es mejor para la pre-entrenamiento, pero disminución de rendimientos establecidos en las últimas 2,000 horas para la mayoría de los dominios.
  3. Filtrado para segmentos relevantes para la manipulación. No todos los cuadros de un video de cocina muestran manipulación. Utilice un modelo de detección de manos fuera de la plataforma (MediaPipe Hands o un YOLO afinado) para extraer sólo segmentos donde las manos son visibles y en contacto con objetos. Esto típicamente reduce el video total en 60-70% mientras se concentra el contenido visual relevante para la manipulación.
  4. Pre-entrenamiento utilizando aprendizaje contrasistido en tiempo. Utilice el objetivo de entrenamiento R3M (contraste en tiempo + alineación de lenguaje) en su video de dominio seleccionado. El entrenamiento dura 24-72 horas en 4x A100 GPUs para una columna vertebral ResNet-50 en 1.000 horas de video. Para ViT-B, presupuesto de 48-96 horas.
  5. Evalúa con los codificadores genéricos. Compare el codificador específico de dominio con DINOv2 y R3M en un pequeño conjunto de 50 demostraciones de robots de tu tarea objetivo.

Resultados esperados de las evaluaciones internas del RCSV: la pre-entrenamiento específico de dominio con 800 horas de video de cocina mejoró la eficiencia de la muestra de manipulación de la política de cocina en un 28% en comparación con el R3M genérico y en un 12% en comparación con el DINOv2, cuando se ajustó a 150 demostraciones de robots. La mejora fue mayor en las nuevas categorías de objetos (artículos de alimentos no incluidos en el conjunto de capacitación de robots), lo que sugiere que el video específico de dominio proporciona un conocimiento sobre objetos particularmente fuerte.

Consideraciones de latencia para el despliegue en tiempo real

Los codificadores de vídeo pre-entrenados varían significativamente en velocidad de inferencia, lo que importa para el control de robots en tiempo real. Una política que se ejecuta a 10 Hz tiene 100 ms por ciclo de control; el codificador visual debe completar un pase hacia adelante dentro de este presupuesto para dejar tiempo para la predicción de la acción y la comunicación por encima.

Codificador Params RTX 4090 (ms) Jetson Orin (ms) CPU Only (ms) Max Control Freq
R3M (ResNet-50) 25M 3-5 8-12 25-40 25+ Hz (all platforms)
DINOv2 ViT-B/14 86M 6-10 18-25 60-90 15+ Hz (GPU required)
DINOv2 ViT-L/14 300M 15-22 40-60 180-250 10 Hz (desktop GPU only)
SigLIP ViT-L/16 300M 14-20 38-55 170-240 10 Hz (desktop GPU only)
VC-1 ViT-L/16 300M 15-22 42-58 185-260 10 Hz (desktop GPU only)

R3M es el único codificador que puede ejecutarse a 20+ Hz en un Jetson Orin, por lo que es la opción práctica para robots desplegados en el borde sin GPU de escritorio. Si su hardware de implementación incluye un RTX 4090 o equivalente, DINOv2 ViT-B proporciona el mejor compromiso de velocidad de calidad. Los modelos ViT-L (DINOv2-L, SigLIP-L, VC-1) son generalmente demasiado lentos para el control en tiempo real en cualquier cosa que no sean GPUs de escritorio y son más adecuados para la evaluación fuera de línea o el procesamiento en lotes.

Para los equipos que necesitan la calidad de un codificador grande a velocidades de inferencia de borde, ** destilación del conocimiento** es un camino viable: entrenar un pequeño codificador de estudiantes (ResNet-50 o ViT-S) para que coincida con las salidas de un maestro grande (DINOv2 ViT-L) en los datos de la cámara robótica. Esto produce un codificador compacto con 70-85% de la calidad de representación del modelo grande a 3-5 veces la velocidad de inferencia. El proceso de destilación requiere que el conjunto de datos de la cámara del robot (mínimo de más de 1.000 cuadros) y 4-8 horas de capacitación en GPU.

Aprendizaje de la representación temporal: Cuadro-nivel vs. características de nivel de clip

Una decisión arquitectónica crítica al utilizar codificadores de vídeo pre-entrenados es si extraer características de marcos individuales o de cortos vídeos.

** Las características de nivel de marco** procesan cada imagen de la cámara de forma independiente a través del codificador. Esta es la integración más simple: la política recibe un vector de características del marco actual (y opcionalmente los anteriores 1-3 cuadros como un historial corto). La mayoría de los sistemas implementados en 2026 utilizan características de nivel de marco porque son compatibles con cualquier codificador de imagen y no añaden gastos generales de cálculo temporal. R3M, DINOv2 y SigLIP producen características de nivel de marco.

** Las características de nivel de clip** procesan una secuencia corta de cuadros (generalmente 4-16 cuadros a 5-15 fps) a través de un codificador de video que captura la dinámica temporal. Los modelos como VideoMAE, TimeSformer y Hiera producen características que codifican información de movimiento - la dirección en que se mueve un objeto, la fase de una acción de manipulación o la velocidad de acercamiento hacia el contacto. Las características de nivel de clip son particularmente valiosas para tareas que involucran interacciones dinámicas: capturar objetos lanzados, doblar tejidos en movimiento o insertar conectores donde la trayectoria de aproximación importa.

El compromiso es concreto: los codificadores de nivel clip requieren 4-16 veces más cálculo por paso adelante (procesando múltiples cuadros frente a uno), lo que reduce la frecuencia máxima de control. Un codificador de video ViT-B que procesa 8 cuadros en un RTX 4090 toma 40-60ms, limitando el control a 15 Hz - marginal para tareas ricas en contactos. DINOv2 ViT-B de nivel de marco toma 6-10 ms en el mismo hardware, permitiendo un control de 50+ Hz con espacio para la predicción de acción.

** Recomendación práctica:** Utilice las características de nivel de marco como opción predeterminada. Para la mayoría de las manipulaciones de mesa -- pick-place, inserción, apilamiento -- las características de nivel de marco con un historial propioceptivo de 3 cuadros proporcionan un contexto temporal suficiente.

Estrategias de transferencia de aprendizaje: congelados vs. codificadores bien ajustados

Una vez que haya seleccionado un codificador pre-entrenado en video, debe decidir si congelar los pesos del codificador durante la formación de políticas o permitirles ajustar los datos de sus robots.

Strategy Robot Demos Training Time In-Distribution OOD Generalización Best When
Fully frozen encoder 50-200 1-2 hours 75-85% 60-75% Limited data, need fast iteration
Frozen + linear probe, then unfreeze last 2 layers 100-300 4-8 hours 82-90% 65-80% Moderate data, balanced in-dist/OOD
Full fine-tuning (low LR) 300-1000 12-48 hours 88-95% 55-70% Abundant data, maximum in-dist performance
LoRA fine-tuning (rank 4-16) 100-500 3-6 hours 84-92% 62-78% Good in-dist with OOD preservation

La clave de las evaluaciones de RCSV: el ajuste fino completo a menudo afecta la generalización de OOD en comparación con los codificadores congelados cuando los datos de los robots son limitados (<200 demostraciones). El ajuste fino de LoRA con el rango 4-16 proporciona el mejor equilibrio para la mayoría de los escenarios prácticos: adapta el codificador a características visuales específicas del robot sin olvidar catastróficamente las representaciones visuales generales.

** Protocolo de formación en dos fases:** Para los equipos con más de 200 demostraciones, utilice un enfoque en dos fases. Fase 1: entrena al jefe de política con un codificador congelado durante 100 épocas para establecer una base de predicción de acción sólida. Fase 2: descongelar las últimas 2-4 capas de codificadores y continuar el entrenamiento con una tasa de aprendizaje 10 veces menor durante 50-100 épocas. Esto evita que el ruido de gradiente temprano corrompa las características previamente entrenadas, mientras que permite la adaptación específica de la tarea.

Comparar el código de código: un protocolo práctico de evaluación

Antes de comprometerse con un codificador específico para una línea de producción, ejecute esta evaluación estructurada para tomar una decisión basada en datos.

  1. Recoge un conjunto de datos de calibración. 50 demostraciones de tu tarea objetivo con 5 instancias de objetos retrasados (nunca utilizados en la formación).
  2. Corre tres candidatos de codificación. Entrenar arquitecturas de políticas idénticas (el mismo eje de acción, los mismos hiperparámetros) con tres variantes de codificación: (a) ImageNet ResNet-50 (línea de base), (b) R3M ResNet-50, (c) DINOv2 ViT-B. Medir la tasa de éxito en la distribución (20 ensayos) y la tasa de éxito OOD en objetos detenidos (20 ensayos).
  3. Computada métricas de calidad de representación. Extraer características de codificación para 100 imágenes de entrenamiento y calcular (a) la varianza de características (más alta = más informativa), (b) la precisión de recuperación del vecino más cercano para la identidad del objeto (más alta = mejor comprensión del objeto), (c) la precisión de la sonda lineal para los atributos relevantes para la tarea (posición del objeto, estado del agarre).
  4. Mejore la latencia de inferencia. Tiempo de paso del codificador hacia adelante en su hardware de implementación (no su GPU de entrenamiento) con tamaño de lote 1. Asegúrese de que encaje dentro de su presupuesto de bucle de control con al menos 30% de espacio para predicción de acción y comunicación.
  5. Toma la decisión. Si el codificador de vídeo (R3M o DINOv2) no supera el nivel de base de ImageNet en al menos un 5% en la evaluación OOD, el codificador de ImageNet más simple puede ser preferible para la simplicidad de implementación.

El enfoque emergente: el video como modelo mundial

El uso más futuro del video en el aprendizaje robótico va más allá del pre-entrenamiento de representación a la modelación del mundo. Cuando se condicionan a las acciones (o descripciones lingüísticas de las acciones), estos modelos pueden predecir lo que sucederá a continuación, proporcionando efectivamente un simulador de física aprendido.

Esto tiene tres aplicaciones concretas para el aprendizaje robótico en 2026:

  • Aumento de datos: Utilice un modelo de generación de video para sintetizar trayectorias visuales plausibles para configuraciones de objetos no presentes en sus datos reales. Las trayectorias generadas no proporcionan etiquetas de acción precisas, pero pueden aumentar la diversidad visual de sus datos de entrenamiento.
  • ** Planificación:** Utilice el modelo de predicción de video como un modelo avanzado en el control predictivo de modelos. Generar futuros visuales predicidos para secuencias de acción candidatas y calificarlos en función de una imagen de objetivo o descripción de lenguaje. Esto permite planificar sin un modelo físico explícito, aunque los modelos de predicción de video actuales son demasiado lentos (segundos por predicción) para MPC en tiempo real en tareas rápidas.
  • ** Aprendizaje de recompensas:** Utilice la calidad de predicción de vídeo como señal de recompensa para RL. Si el comportamiento de un robot produce observaciones que un modelo de predicción de vídeo asigna una alta probabilidad, el comportamiento es probablemente físicamente plausible. Esto proporciona una señal de recompensa densa derivada de la "intuición física" incrustada en el modelo de video.

Modelos de generación de video y de Sora. Los modelos de generación de video a gran escala (OpenAI Sora, Runway Gen-3, Google Veo) pueden generar secuencias de manipulación físicamente plausibles a partir de descripciones de texto. Los experimentos preliminares en RCSV muestran que la ajuste fino de DINOv2 en una mezcla de video de robot real y de manipulación generado por Sora mejora la calidad de la representación visual en un 3-7% en la evaluación de políticas en curso, probablemente porque los videos generados aumentan la diversidad de apariencias de objetos y tipos de interacción en los datos pre-entrenamiento.

Estos enfoques son en fase de investigación en 2026, no listos para la producción. Pero representan la dirección en la que se está moviendo el campo, y los equipos que construyen infraestructura de datos hoy deben considerar la compatibilidad con los modelos con video en condiciones como un criterio de diseño prospectivo.

Aproveche el mejor de ambos enfoques

Los servicios de recopilación de datos de RCSV ((T9) y [plataforma de datos] (T10) se basan en el enfoque híbrido que apoya la investigación: codificadores visuales preentrenados con video combinados con datos de demostración de robots de alta calidad para el aprendizaje en acción. Nuestra línea de recogida exporta datos en formatos compatibles con las principales arquitecturas VLA, incluidos los modelos Octo, OpenVLA y RT-2-style, con etiquetas de instrucción de lenguaje incluidas por defecto.

Si está comenzando un proyecto de aprendizaje de robots y desea maximizar la eficiencia de la muestra desde el principio, explore nuestra [guía de aprendizaje de imitación]T11) para un enfoque paso a paso para combinar la pre-entrenamiento de video con la recopilación de datos del mundo real dirigida.

Lectura relacionada

  • [Abrir el cuerpo X: el conjunto de datos del robot que cambió todo]
  • [Aprendizaje por imitación para robots: desde las demostraciones hasta la implementación]
  • [Leyes de escala para el aprendizaje de robots: lo que sabemos en 2026]
  • [Política de ACT vs. Difusión: cuándo usar cuál]
  • [Generalización de la política de robots: por qué su robot falla en nuevos objetos]
  • [Servicios de recogida de datos del RCSV]

Combine el video pre-entrenamiento con demostraciones de alta calidad

La plataforma de RCSV admite codificadores de vídeo pre-entrenados con datos de teleoperación de alta calidad para una máxima eficiencia de la muestra.

[Leer la Guía de aprendizaje por imitación]