RoboFlamingo
RoboFlamingo: modelo de lenguaje de visión basado en OpenFlamingo para la manipulación de robots. ByteDance, Tsinghua, SJTU, NUS. MIT, Hugging Face.
[← Modelos]
Modelos de la Fundación del lenguaje de visión como imitadores de robots efectivos.
En general
RoboFlamingo se basa en OpenFlamingo para combinar la comprensión del lenguaje de visión en un solo paso con una política explícita para el control de robots secuenciales.
Arquitectura y rendimiento
- La columna vertebral de OpenFlamingo (variantes MPT-3B, 4B, 9B)
- Líder de políticas para la toma de decisiones secuenciales
- Fuerte en el índice de referencia CALVIN
- Control de circuito abierto, despliegue de recursos bajos
Enlaces oficiales
- [roboflamingo.github.io]
- github.com/RoboFlamingo/RoboFlamingo
Código (MIT) - [Reflexión de cara: robovlms/RoboFlamingo]
Citación
Consulte el sitio web del proyecto para BibTeX y referencias en papel.
Cada VLA aquí puede ser ajustado a sus propias demostraciones.
Recoge demos → Hardware que lo ejecuta → Corre una política →







