Volver a Blog

La formación de modelo VLA en un presupuesto: lecciones de más de 100 tonos de música

LoRA/QLoRA, control de gradientes, FlashAttention, A100/H100 vs GPUs de consumo, y el tradeoff conjunto de datos vs modelo <unk> el libro de juego de ajustes de VLA en presupuestos del mundo real.

El ajuste fino de un modelo de acción del lenguaje de visión de 7B-parámetro suena como una actividad de laboratorio de frontera. No es, si escoges el modelo base correcto, el método de parámetro eficiente correcto y los modos de falla adecuados para optimizar. Aquí es lo que hemos aprendido a ejecutar este bucle cientos de veces.

Publicado 2026-04-03 por el Centro de Investigación de Robótica del Valle del Silicio.

TL;DR. No se necesita un grupo H100 para ajustar una VLA útil. Un solo H100 con LoRA (o QLoRA en un presupuesto más pequeño) más FlashAttention-2 y control de gradiente ajustará a OpenVLA en unos cientos de episodios durante la noche. Octo ajusta a la perfección en una tarjeta de 24 GB de consumo en una tarde. El recurso escaso casi nunca es FLOPs es limpio, bien etiquetado, bien envasado datos de demostración. Compra computación a pedido; invierta estructuralmente en datos. Elige Octo para conjuntos de datos pequeños y realizaciones únicas; elige OpenVLA cuando tienes >500 episodios o necesitas un condicionamiento de lenguaje.

1. Enmarcar correctamente el presupuesto

Antes de elegir una GPU o un modelo, enmarque su presupuesto como un solo número: costo por "evaluación útil". No costo por época, no costo por paso de gradiente, no costo por TFLOP. Una evaluación útil es un lanzamiento exitoso en un robot real, medido con un protocolo de evaluación fijo. Cada dólar gastado en computación, ingenieros o datos debe ser rastreable para mejorar ese número.

Esto suena obvio y se viola rutinariamente. Los equipos pasan seis semanas optimizando una receta de entrenamiento para reducir el 15% del tiempo de reloj de pared, luego descubren que su protocolo de evaluación no puede distinguir dos políticas que difieren en 20 puntos porcentuales en la tasa de éxito en el mundo real.

2. Elige el modelo base por el tamaño del conjunto de datos, no por el prestigio

Octo

Octo es el estándar correcto cuando su conjunto de datos de demostración es modesto (aproximadamente <500 episodios por tarea), su realización es un solo brazo conocido, y no necesita un acondicionamiento de lenguaje de vocabulario abierto. Su decodificador de acción es simple, lo que significa que los modos de falla son fáciles de diagnosticar.

VLC abierto

OpenVLA es el estándar correcto cuando tienes >500 demostraciones, necesitas un comportamiento condicionado por el lenguaje o quieres beneficiarte de un entrenamiento previo a cada cuerpo. La base de parámetros 7B significa que querrás al menos un A100 de 40 GB o, idealmente, un H100 de 80 GB para tamaños de lotes cómodos con LoRA. Nuestra modelos VLA explicados publicación cubre el lado de la arquitectura; nuestra lista curada vive en /vla-models/.

pi0 y otros

Varios VLAs fronterizos (pi0 y sus descendientes) superan a OpenVLA en las tareas más difíciles, pero conllevan costos de computación y licencias más pesados. Para la mayoría de los equipos, esta es una optimización prematura.

Regla de oro. Doble el conjunto de datos antes de duplicar el modelo. Pasar de 300 a 600 demostraciones bien curadas supera confiablemente pasar de un modelo 1B a un modelo 7B, a una fracción del costo de cálculo.

3. Ajuste delineado de los parámetros: LoRA, QLoRA y cuando cada uno gana

Loura

LoRA une pequeñas matrices de adaptadores de rango entrenables a cada atención y peso de MLP, congelando la base. Para un VLA 7B, LoRA con rango 16-32 reduce los parámetros entrenables en ~ 100x, reduce dramáticamente la memoria y, en nuestra experiencia, coincide con el rendimiento de ajuste fino completo en la mayoría de las tareas de manipulación en aguas subyacentes.

Cloruro

QLoRA carga el modelo base congelado en cuantización NF4 de 4 bits y entrena los adaptadores LoRA en la parte superior. A un pequeño costo de rendimiento, reduce aproximadamente a la mitad la memoria de LoRA. QLoRA es lo que hace posible el ajuste fino de OpenVLA en un solo A100 de 40 GB o en una tarjeta de consumo de 24-32 GB, y es nuestra recomendación para equipos sin acceso a H100. La biblioteca Hugging Face PEFT hace que ambos métodos sean posibles con unas pocas líneas de código.

Cuando para la completa ajuste fino

La perfección de la técnica sólo supera a LoRA cuando (a) se dispone de un conjunto de datos muy grande (> 10k episodios, variados en la realización) o (b) la tarea posterior es suficientemente diferente de la pre-entrenamiento que los adaptadores no pueden cerrar la brecha.

4. Los trucos de memoria y rendimiento que realmente importan

FlashAttention-2

FlashAttention-2 no es opcional. Utilice la versión combinada con la biblioteca de transformadores de su elección. En un modelo 7B con 1024 tokens, normalmente reduce la memoria de atención en 3-4 veces y acelera el entrenamiento de extremo a extremo en un 20-40%.

Control gradual

Computación de comercio por memoria. Con el control de gradiente en marcha, la memoria de activación máxima para un modelo 7B disminuye aproximadamente un factor de 2 a un costo de ~20-30% de rendimiento. En las tarjetas con restricción de memoria esto es una victoria inequívoca.

Formación de precisión mixta

Use bfloat16 en Ampere y Hopper; prefiera que en fp16 para la estabilidad numérica en los tonos finos de VLA. Mantenga el estado de optimizador en fp32 a menos que esté activamente hambriento de memoria; el dividendo de estabilidad vale la memoria extra.

Tamaño efectivo del lote mediante acumulación

Si su hardware no puede ajustarse al tamaño de lote que desea su receta, utilice la acumulación de gradientes para construirlo. Para los afines de LoRA, los tamaños de lote efectivos de 64-128 suelen ser más que suficientes; empujar más alto rara vez ayuda.

Compilación

PyTorch 2.x torch.compile nos da un rendimiento del 10-25% en la mayoría de los casos con cero cambios de código, siempre y cuando el modelo no tenga flujo de control de forma variable. Siempre vale la pena probar una vez por receta.

5. Opciones de cálculo: qué se ejecuta donde

GPU VRAM OpenVLA (QLoRA) OpenVLA (LoRA bf16) Octo fine-tune Typical use
RTX 3090 / 4090 24GB Works, small batch Tight, small batch Comfortable Solo researchers, prototypes
A6000 / L40S 48GB Comfortable Works Very comfortable Small labs, shared workstation
A100 40GB 40GB Comfortable Works, modest batch Very comfortable Cloud default, good value
A100 80GB / H100 80GB 80GB Large batch Comfortable Overkill Production, multi-run sweeps

El precio de la nube varía enormemente; las instancias de spot en las nubes principales superarán confiablemente las de demanda en un 40-70% si su bucle de entrenamiento tolera la preempción.

6. Tamaño del conjunto de datos frente al tamaño del modelo: el verdadero tradeoff

En nuestra experiencia en más de 100 toques finos, el único indicador más fuerte de la tasa de éxito en el downstream es la calidad de los datos de demostración, no el tamaño del modelo. El segundo más fuerte es la configuración de la cámara apropiada para la tarea.

Concretamente: una 7B OpenVLA afinada en 200 demostraciones ruidosas e inconsistentemente etiquetadas, normalmente será inferior al Octo más pequeño entrenado en las mismas 200 demostraciones después de un día de curado. Nuestros conjuntos de datos seleccionados y validados se encuentran en el catálogo de conjuntos de datos del RCSV y nuestro equipo ejecuta los compromisos de curaduría.

Hay un corolario práctico: si su sintonía fina no está funcionando, sus tres primeras hipótesis deben ser todas sobre datos. Los límites de episodios malos, la normalización inconsistente de la acción, la deriva de la cámara entre sesiones de grabación y las señales de éxito mal etiquetadas son juntos responsables de la mayoría de los fallos de sintonía fina que hemos diagnosticado.

7. Evaluación: la otra mitad del presupuesto

Un VLA ajustado es un pasivo sin un bucle de evaluación de confianza.

  • Acción fuera de línea-MSE. Chequeo de salud mental rápido. Barato. No predice el éxito en el mundo real.
  • ** Ensim Rollout.** Un ambiente de sim que refleja su tarea real. útil como pre-filtro antes de quemar tiempo robot. Nuestros [sim-to-real consejos]T7) cubre los gotchas.
  • ** Real-robot de implementación.** La única fuente de verdad. Presupuesto de al menos 50 implementaciones por evaluación. Nuestra [lista de control de implementación]

Para los equipos que no disponen de un robot de evaluación dedicado, el [programa de arrendamiento del RCSV]T9) puede proporcionar tiempo de evaluación sobre hardware calibrado útil para las solicitudes de los revisores y garantías de reproducibilidad.

8. Arquetipos presupuestarios

El investigador en solitario (de 0 a 500 dólares al mes)

Un 3090 o 4090. QLoRA de Octo y OpenVLA. Lugar de nube para la carrera ocasionalmente más grande. enfoque: una tarea, una realización, evaluación rigurosa. Nuestra guía [LeRobot comenzando] T10) es la más rápida en la rampa.

El pequeño laboratorio (2-5K$/mes)

Un A6000 o A100 compartido a través de la nube. LoRA OpenVLA como predeterminado; Octo para la iteración rápida. Invertir fuertemente en un pequeño (200-1000 episodios) conjunto de datos curados por tarea. [Compare plataformas de robots] T11) antes de comprometerse con el hardware.

El piloto empresarial (20-50K/mes)

Reserva el acceso a H100, construye barridos de múltiples semillas en cada experimento, invierte en un gasoducto dedicado de curado de datos. En este presupuesto el cuello de botella rara vez es computacional; es el rendimiento de datos y el rigor de evaluación. Nuestro equipo [servicios de datos] T12) maneja la construcción de conjuntos de datos para equipos a esta escala.

9. Trampas comunes

  • Overtraining. Los adaptadores LoRA se adaptan rápidamente a pequeños conjuntos de datos.
  • Acción normalización no coincide. Si su conjunto de datos fue grabado con una normalización y se implementa con otra, obtendrá una política que se ve sano en el papel y falla en el hardware. congelar su normalización y versión.
  • Drift de la cámara. Calibración externa vaga durante meses. Recalibra antes de cada ejecución de la recopilación de datos. Ver configuración de la cámara robot.
  • Erros de límite de episodios. Si su conjunto de datos tiene episodios segmentados incorrectamente, LoRA aprenderá de manera obediente lo equivocado.
  • Clamar una brecha que no existe. Si su evaluación prolongada tiene 50 ensayos y ve una diferencia del 5%, tiene ruido de medición, no un resultado.

10. Nota de cierre

El libro de juego de sintonización de VLA ya no es solo de laboratorio de investigación. Octo y OpenVLA más LoRA más una única GPU bien utilizada es suficiente para producir resultados de calidad de publicación para la mayoría de las tareas individuales y problemas de un solo cuerpo. Lo que separa a los equipos que tienen éxito de los equipos que luchan no es la computación. Gasta en consecuencia.

Para el hardware, nuestra tienda, herramienta de comparación, y guías para compradores son la forma más rápida de dimensionar un programa. Para detalles a nivel de banco, nuestros tutoriales recetas de entrenamiento específicas. Cuando esté listo para evaluar a escala, entrá en contacto.

** Lectura relacionada:** modelos VLA explicados, lista de verificación de calidad de datos de teleoperatoria, pilla de robótica de código abierto 2026, y estado del aprendizaje de robots Q1 2026.

11. Preguntas frecuentes

¿El rango de la LoRA importa mucho?

El rango 16-32 funciona para la mayoría de las canciones de VLA. El rango 8 ocasionalmente se reduce en tareas bimanual; el rango 64 ocasionalmente se sobrepasa en pequeños conjuntos de datos. Si no está seguro, comience en el 32 y solo sintonice si tiene un síntoma específico.

¿Deberíamos entrenar de cero?

Casi nunca. El entrenamiento previo de un VLA 7B desde cero requiere presupuestos que hacen que el ajuste fino sea irrelevante. Comience desde los puestos de control OpenVLA o Octo. El único caso para el entrenamiento desde cero es un espacio de acción genuinamente novedoso que no está cubierto por ningún puesto de control abierto.

¿Cómo decimos cuándo se termina la formación?

No por curvas de pérdida. Por la tasa de éxito de evaluación prolongada, idealmente en un robot real. Fija un presupuesto de evaluación (por ejemplo, 50 lanzamientos por punto de control) y detente temprano en esa métrica, con una paciencia de 1-3 eval runs.

¿Qué hay del uso de memoria de la Política de Difusión?

La política de difusión es a menudo más ligera que las VLAs porque la columna vertebral visual es más pequeña. Una sola tarjeta de 24 GB la entrena cómodamente en la mayoría de las tareas de mesa. El cuello de botella es generalmente la carga de datos, no la memoria GPU.