Volver a Research

OpenVLA vs Octo: ¿Qué modelo de aprendizaje de robots elegir?

OpenVLA vs Octo comparación: arquitectura, datos de entrenamiento, ajuste fino, despliegue. ¿Qué modelo de VLA para tu robot?

[← Investigación]

Una comparación práctica para investigadores y constructores que elijan un modelo de lenguaje de visión-acción (VLA).

Modelos de VLA que trazan la percepción + el lenguaje a las acciones

Imágenes Acciones del lenguaje

Tanto OpenVLA como Octo son modelos de acción de lenguaje de visión de código abierto para el aprendizaje robótico. Aquí está cómo comparan y cuándo usar cada uno.

Arquitectura

OpenVLA se basa en Prismatic VLM y añade cabezas de predicción de acción. Suporta múltiples morfologías de robots y espacios de acción. Octo utiliza una arquitectura basada en transformadores entrenada en datos de Open X-Embodiment.

Datos de formación

Octo está capacitado en Open X-Embodiment (RT-X, BridgeData, DROID, etc.). Ambos se benefician de datos de robots a gran escala y diversos. Ver nuestro [catálogo de Dataset]T3) para las fuentes de datos.

La acondicionamiento

Los dos soportan ajustes finos en su robot y tarea. Por lo general, 50500 demostraciones pueden mejorar el rendimiento significativamente. OpenVLA ofrece puntos de control para diferentes tipos de robots. La arquitectura de Octo es flexible para nuevos espacios de acción.

Cuándo elegir OpenVLA

  • Necesitas un rendimiento fuerte fuera de la caja en tareas comunes de manipulación
  • Su robot es similar a los de Open X-Embodiment (WidowX, ALOHA, etc.)
  • Quieres un modelo bien documentado y mantenido activamente

Cuándo elegir el Octo

  • Estás experimentando con nuevas morfologías robóticas.
  • Quieres la máxima flexibilidad para espacios de acción personalizados
  • Estás construyendo directamente en datos de Open X-Embodiment

Recopilación de datos para ajuste

Cualquiera que sea el modelo que elijas, probablemente necesitarás demostraciones específicas de tareas. Ofrecemos [servicios de recopilación de datos]T4) para el aprendizaje de imitación teleoperación, formato listo para el aprendizaje y QA.

Vea todos los modelos de VLA →

Leer sobre la evaluación es una cosa probar una política sobre hardware real es otra.

Ejecutar una evaluación del mundo real → Datos de evaluación de la Comisión → Hardware para su equipo de evaluación →