Volver a Research

Modelos de base para la manipulación de robots: RT-2, OpenVLA, Octo y π0

Encuesta de modelos de base para la manipulación de robots en 2025 <unk> arquitecturas, datos de capacitación, capacidades y consideraciones de implementación.

[← Investigación]

El panorama actual de los grandes modelos pre-entrenados para la manipulación de robots lo que pueden hacer, cuánto cuestan para ajustarlos y cómo elegir entre ellos.

Lo que hace un modelo de base de robot

Un modelo de base de robot es una red neuronal grande pre-entrenada en diversos datos de interacción de robots (y a menudo datos web) que se pueden ajustar a nuevas tareas con relativamente pocas demostraciones análogo a cómo GPT-4 o CLIP se pueden ajustar a tareas de visión o NLP específicas de dominio.

La propiedad crítica es la transferencia: el modelo debe haber aprendido representaciones generalizables de objetos, escenas y acciones que se aplican a tareas en las que no fue entrenado explícitamente.

Los modelos de fundación no son universalmente superiores a las políticas específicas de tareas. Para un despliegue de tareas únicas bien ampliado, una política de ACT o difusión bien entrenada en demostraciones específicas de tareas 5001,000 superará a un modelo de fundación ajustado. Los modelos de fundación dan sus frutos cuando se necesita una rápida adaptación a muchas nuevas tareas (> 10 nuevas tareas por trimestre) o cuando se tienen muy pocas demostraciones para una nueva tarea (550 tomas).

RT-2: Transformador robótico 2

RT-2 (Google DeepMind, 2023) es el modelo de base de robots más citado. Alinea un modelo de lenguaje de visión grande (PaLI-X, parámetros 55B) para emitir acciones de robots tokenizadas como texto, entrenando en una combinación de datos de imagen web-texto y datos de trayectoria del robot simultáneamente.

  • Arquitectura: La columna vertebral de PaLI-X VLM con fichas de acción adjuntas al vocabulario.
  • ** Datos de entrenamiento:** ~130K episodios de robots de un conjunto de datos RT-1 (tareas de cocina de robots de Google) más datos masivos de texto/imagen web.
  • Resultados clave: RT-2 logra un 62% de éxito en objetos nuevos y un 55% en fondos nuevos con generalización de disparos cero, frente a los 32% y 28% de RT-1 respectivamente. Puede responder a instrucciones de lenguaje natural como "recoger el objeto que se puede usar para apagar un fuego".
  • Costo de inferencia: Para ejecutar los parámetros 55B se requiere un servidor multi-GPU. No se puede implementar en el hardware de borde.
  • Limites: Pesos cerrados (internos de Google). No pueden ser ajustados directamente por equipos externos.

VLC abierto

OpenVLA (Stanford + UC Berkeley, 2024) es el modelo de fundación de robots de peso abierto líder a partir de 2025. Se basa en un modelo de lenguaje LLaMA-2 con parámetro 7B con un codificador de visión DINOv2 + SigLIP, afinado en el conjunto de datos Open X-Embodiment.

  • Arquitectura: VLM prismático (LLaMA-2 7B + DINOv2 codificador de visión). salida de acción a través de la discretization tokenized (256 contenedores). entrada: 512×512 imagen + instrucción de lenguaje natural.
  • ** Datos de formación:** Datos abiertos de X-Embodiment más de 1 millón de episodios de robots de 22 tipos diferentes de robots en 22 instituciones de investigación.
  • Peso abierto: Peso de modelo publicado en HuggingFace (openvla/openvla-7b).
  • Costo de ajuste fino: El ajuste fino de LoRA en 1.000 demostraciones específicas de tareas tarda aproximadamente 48 horas en una sola GPU A100 (~ $ 500 $ 800 en computación en la nube).
  • Velocidad de inflexión: ~500 ms por acción en A100 (7B parámetros).
  • ** Performance:** Compatibilidad con o superior a RT-2 en las tareas de referencia BridgeV2.

Octo

Octo (Berkeley, 2024) adopta un enfoque arquitectónico diferente: un modelo de transformador más pequeño con una cabeza de acción de política de difusión, entrenada enteramente en datos robóticos (sin datos web). Esto hace que sea más rápido para ajustar y desplegar.

  • Arquitectura: Codificador de observación de transformador (imágenes + propriocepción + lenguaje) + cabeza de acción de difusión.
  • ** Datos de formación:** 800.000 demostraciones de robots de Open X-Embodiment (filtrados por calidad).
  • Velocidad de inferencia: ~30100 ms por acción en una GPU estándar.
  • Aunificación fina: 1.000 demostraciones ajustadas en < 1 hora en un solo A100. Ciclo de iteración mucho más rápido que los modelos basados en VLM.
  • Limitations: No entiende la semántica del lenguaje natural, así como los modelos basados en VLM. Peor en la generalización de objetos novedosos de captura cero. Mejor para escenarios donde tienes datos de ajuste fino específicos de tareas.

π0 (Inteligencia física)

π0 (Inteligencia Física, 2024) es el modelo de base de robot más capaz para la manipulación bimanual dexterosa. Utiliza una cabeza de acción de flujo (una variante de flujo de normalización continua) que evita algunos de los artefactos de discretizamiento de las salidas de acción tokenizadas.

  • Arquitectura: VLM (PaLI-Gemma) + cabeza de acción de flujo.
  • Capacidades: Demostrado en el plegado de ropa, la mesa de la mesa, la fabricación de sándwiches tareas bimanual de alta destreza con objetos deformables que otros modelos no han combinado.
  • ** Disponibilidad:** No de peso abierto. Disponible a través de la API comercial de Physical Intelligence (acceso limitado, precios empresariales). No auto-hostable.
  • Vantaja de la combinación de flujos: La combinación de flujos evita los contenedores de discretization requeridos por las salidas de acción tokenizadas, permitiendo acciones más suaves y precisas, particularmente importantes para tareas de mano de alto DOF y bimanual.

Comparación de las capacidades

Model Params Weights Zero-Shot Fine-Tune Cost Inference Speed Best For
RT-2 55B Closed Excellent N/A 1–3 s Google internal
OpenVLA 7B Open Good $500–$800 100–500 ms Open research, fine-tuning
Octo 93M Open Moderate <$100 30–100 ms Edge deployment, fast iteration
π0 ~3B Closed API Excellent Custom Unknown Dexterous bimanual
Task-specific ACT ~300M N/A None $50–$200 15–30 ms Single well-scoped task

Considerancias en cuanto a la implementación

  • ** Cuantización:** La cuantización de OpenVLA INT8 reduce la memoria de la GPU de 14 GB a ~ 7 GB con una degradación de rendimiento <5%. INT4 (4 bits) se reduce a ~ 3.5 GB con una degradación del 812%.
  • Inferencia de borde: Octo (93M parámetros) es el único modelo de base actual que se ejecuta cómodamente en NVIDIA Jetson AGX Orin. OpenVLA y π0 requieren un servidor. Para la implementación de borde de modelos más grandes, considere ejecutar inferencia en un servidor de GPU ubicado en una misma ubicación conectado al robot a través de Ethernet.
  • ** Datos de ajuste fino:** Incluso los modelos de base se benefician sustancialmente de 2001,000 demostraciones sobre la tarea objetivo específica y el robot.

El RCSV plataforma de entrenamiento admite la ajuste fino de OpenVLA y Octo con una interfaz de un clic. Traiga sus demostraciones recopiladas y manejamos el cálculo, la búsqueda de hiperparámetros y la evaluación con respecto a los puntos de referencia estándar.

Afinar un modelo de base en sus datos

RCSV proporciona ajustes finos administrados para OpenVLA y Octo en sus datos de demostración específicos de tareas.

[Entrenamiento inicial →]