Volver a Research

Modelos de base de robots de ajuste fino: una guía práctica

Cómo ajustar los modelos de base de robots (OpenVLA, Octo, π0) a su tarea <unk> requisitos de datos, configuración de capacitación y ganancias de rendimiento esperadas.

[← Investigación]

Los modelos de base de robots reducen los requerimientos de datos en 310× para nuevas tareas.

Por qué no se debe poner de pie a la nada

El entrenamiento de una política de manipulación desde cero requiere miles de demostraciones específicas de tareas.

Un modelo de base de robot pre-entrenado en diversos datos visuales a escala de Internet y miles de demostraciones de robots ya entiende: semántica visual ("copa roja" vs. "mopa azul"), affordances de objetos (las copas son agarradas por el borde o el cuerpo), conexión a tierra del lenguaje ("recoger" vs. "empujar"), y antecedentes de acción básicos (trayectorias lisas, ángulos de aproximación).

El ajuste fino transfiere estos antecedentes a su tarea específica. El resultado es 310× eficiencia de muestra: donde el entrenamiento desde cero podría requerir 5.000 demostraciones, el ajuste fino de un modelo de base a menudo logra un rendimiento comparable con 200500. Esta diferencia significa semanas de recopilación de datos frente a días.

Opciones de modelo de fundación

  • OpenVLA (7B parámetros, LLaMA espina dorsal, pesos completamente abiertos) el modelo de base más accesible para el ajuste fino a partir de 2025.
  • ** Octo** (transformador 90M + cabeza de acción de difusión, pesos completamente abiertos) inferencia más rápida (25 Hz en un solo A100) y menor costo de ajuste fino que OpenVLA. La cabeza de difusión genera trayectorias suaves. Menos generalización visual que OpenVLA pero excelente para tareas de distribución interna. Publicado en CoRL 2024.
  • π0 (Inteligencia física, arquitectura de coincidencia de flujo, acceso restringido) Estado de la técnica en los puntos de referencia de manipulación hábiles a partir de principios de 2025. La coincidencia de flujo produce trayectorias de alta calidad para tareas ricas en contacto. Acceso a través del programa de asociación de Inteligencia Física; no está completamente abierto a la fecha de la redacción. La mejor opción si la manipulación hábil (doblamiento, ensamblaje) es el objetivo.
  • RoboFlamingo / 3D-VLA Alternativas emergentes con un fuerte razonamiento espacial 3D. Observe estas tareas que requieren una colocación precisa en 3D.

Requisitos de datos

Número mínimo de demostración para ajuste fino frente a entrenamiento desde cero:

  • Auroración de OpenVLA: 50500 demostraciones dependiendo de la complejidad de la tarea. Simples y colocados: 50 demostraciones a menudo suficientes. Ensamblaje complejo en múltiples pasos: 300500. Recoge con cámara montada en la muñeca + vista externa.
  • Auroración fina de octo: 2001,000 demostraciones. Un poco más hambrienta de datos que OpenVLA para la misma tarea, pero más rápida para entrenar. Particularmente eficiente cuando su tarea es similar a BridgeData (manipulamiento de mesa).
  • **Entrenamiento desde cero (ACT, Política de difusión) **: 5.000 a 50.000 demostraciones dependiendo de la tarea.
  • La calidad de los datos es más importante que la cantidad. 100 demostraciones de expertos (suaves, consistentes, sin dudar) superan a 500 demostraciones mediocres.

Configuración de la formación

Requisitos prácticos de cálculo para el ajuste fino:

  • ** OpenVLA completo ajuste fino**: 4× A100 80GB, aproximadamente 8 horas para 500 demostraciones, 10.000 pasos de gradiente.
  • OpenVLA con LoRA: Rank-16 LoRA reduce la memoria para caber en un solo A100 de 40 GB con una pérdida mínima de rendimiento (normalmente <5% de diferencia de tasa de éxito frente a ajuste fino completo). Tiempo de entrenamiento: 34 horas.
  • **Auroración de Octo: 1× A100 40GB, 24 horas para 200500 demostraciones. Opción más rentable para tareas moderadas.
  • Use HuggingFace <unk>T0 + <unk>T1 para OpenVLA LoRA. La biblioteca <unk>T2 proporciona scripts de ajuste fino Octo. Valida en un 20% de sus demostraciones antes de ejecutar la evaluación de hardware.

Resultados esperados

Model Demos Required Expected Success Rate (Fine-Tune) Training from Scratch (Same Demos)
OpenVLA 100 55–70% 15–30%
OpenVLA 300 70–85% 35–55%
Octo 200 60–75% 20–40%
Octo 500 75–88% 45–65%
π0 (if available) 100 65–80% N/A (requires much more)

Los números son aproximados y dependen de la tarea. Las tareas de pick-and-place con distinción visual clara están en el extremo superior. La manipulación dexterosa (tecido, objetos deformables) está en el extremo inferior. Siempre valida en objetos mantenidos.

Los modos comunes de fracaso

  • Lobos catastróficos La ajuste fino sobrepone las características pre-entrenadas, degradando la generalización. Solución: utilice LoRA (congela la mayoría de los pesos) o añada una pequeña fracción de datos pre-entrenados a su mezcla de ajuste fino.
  • ** Collapso de modo** La política converge a un único comportamiento (por ejemplo, siempre se aproxima desde el mismo ángulo) ignorando la variedad de objetos. Solución: aumentar la diversidad de los conjuntos de datos, agregar el aumento (ultraces aleatorios, nerviosismo de color), asegurar que los objetos de entrenamiento varían en posición y orientación.
  • Sobreajuste política memorizan demostraciones de entrenamiento.
  • ** Desajuste de distribución de acción** El espacio de acción de su robot (ángulos conjuntos, posición de efecto final) no coincide con el formato esperado del modelo de base.

Despliegue

Después de ajuste fino, optimiza la velocidad de inferencia en tu hardware de implementación:

  • **Exportación de ONNX ** exportación de OpenVLA o Octo a ONNX para la implementación hardware-agnóstica. Reduce la carga general de Python, permite la implementación de bordes.
  • TensorRT para Jetson convertir ONNX en motor TensorRT para NVIDIA Jetson AGX Orin. el modelo OpenVLA LoRA funciona a 46 Hz en Jetson AGX Orin con cuantización INT8.
  • Cuantización Cuantización INT8 reduce el tamaño del modelo en 4× con una disminución de la tasa de éxito <3% para la mayoría de las tareas de manipulación.

Accede a la infraestructura de ajuste fino y a los conjuntos de datos recogidos a través de la plataforma [RCSV]T5), o explore nuestros [servicios de recogida de datos]T6) para obtener una recogida de demostración de alta calidad.

Iniciar la ajuste en los conjuntos de datos RCSV

Acceda a conjuntos de datos de manipulación seleccionados, infraestructura de capacitación de GPU y entornos de evaluación para ajustar los modelos de base de robots en sus tareas.

[Explorar los Servicios de Datos]