LIBERO vs. CALVIN: Comparación de referencia de aprendizaje de robots 2026
LIBERO vs. CALVIN en 2026: conjuntos de tareas, demostraciones, condicionamiento de lenguaje, encarnaciones y licencias comparadas. Elige el punto de referencia adecuado para el aprendizaje de robots a lo largo de la vida o a largo plazo.
LIBERO y CALVIN son dos de los puntos de referencia simulados más citados en el aprendizaje robótico moderno. Ambos se dirigen a la manipulación condicionada por el lenguaje, pero fueron diseñados con objetivos de investigación muy diferentes: LIBERO para el aprendizaje permanente y la evaluación de VLA en conjuntos de tareas discretas, CALVIN para cadenas de habilidades de largo horizonte en un entorno de mesa compartido. Si usted está eligiendo cuál de ellos debe informar los números en 2026, esta guía le da una comparación directa entre la escala, la estructura, el idioma, la realización, la computación y las licencias.
TL;DR
- ** Aprendizaje permanente y permanente:** LIBERO es el estándar
fue construido explícitamente para la evaluación de la transferencia de conocimientos en cuatro conjuntos de tareas. - Cadenas de lenguaje de largo horizonte: CALVIN gana
su punto de venta único es la evaluación de secuencias de hasta cinco instrucciones de lenguaje en una implementación. - Modeles de referencia de VLA: LIBERO es más común en los documentos recientes (OpenVLA, [pi0, Octo](
T2 )) porque sus suites discretas son fáciles de informar. - Generalización de la división del medio ambiente: CALVIN gana
cuatro entornos visualmente distintos (A, B, C, D) dan un protocolo de trenes/pruebas limpio fuera de la caja. - ** Facilidad de funcionamiento local:** LIBERO es más ligero
Robosuite + MuJoCo, T0 .
En un vistazo
| Attribute | LIBERO | CALVIN |
|---|---|---|
| First release | 2023 (NeurIPS D&B track) | 2022 (RA-L) |
| Primary goal | Lifelong learning + imitation / VLA eval | Long-horizon language-conditioned manipulation |
| Task suites | 4 suites: Spatial, Object, Goal, LIBERO-100 (Long) | 34 skill classes, chained into sequences of 5 |
| Total tasks | ~130 tasks | One shared environment with compositional task chains |
| Demostración scale | Around 6500 human teleoperation demos (50 per task) | ~24 hours of teleoperation across 4 environments |
| Simulator | Robosuite / MuJoCo | PyBullet (custom tabletop) |
| Embodiment | Franka Emika Panda (7-DoF) | Franka Emika Panda (7-DoF) with parallel gripper |
| Environment splits | Per-suite train/test with held-out configurations | Environments A, B, C, D for zero-shot transfer |
| Language labels | Yes, per task | Yes, crowdsourced natural language instructions |
| Evaluation metric | Success rate per suite + forward / backward transfer | Avg. sequence length successfully completed (out of 5) |
| License | MIT | MIT |
| Paper | arXiv:2306.03310 | arXiv:2112.03227 |
Lo que LIBERO realmente prueba
LIBERO ("Lifelong learning benchmark for robot manipulation") fue construido en la UT Austin y sus colaboradores como respuesta a una brecha en la literatura de aprendizaje por imitación: la mayoría de los benchmarks anteriores medían la calidad de la política en una distribución de tareas fija, pero muy pocos medían cómo un robot acumula y transfiere conocimientos a medida que llegan nuevas tareas. El índice de referencia se estructura en cuatro conjuntos de tareas, cada uno con alrededor de 10 tareas y 50 demostraciones de teleoperación por tarea, para un total de aproximadamente 130 tareas y 6.500 trayectorias.
Las cuatro suites son LIBERO-Spatial (los mismos objetos, diferentes relaciones espaciales), LIBERO-Object (diferentes instancias de objetos en el mismo diseño), LIBERO-Objetivo (diferentes instrucciones de objetivos con objetos compartidos) y **LIBERO-100 (Longa) **, un conjunto mucho más difícil de 100 tareas de horizonte largo extraídas de escenas realistas de cocina y sala de estar. Los tres primeros están diseñados para aislar un solo eje de desplazamiento de distribución; LIBERO-100 mezcla todo.
Lo que hace que LIBERO sea atractivo para la evaluación moderna de VLA es que la estructura de tareas discreta se asigna limpiamente al estilo de la lista de resultados. Cuando se evalúan [OpenVLA, Octo, pi0, y políticas de fundación similares]
Lo que realmente prueba CALVIN
CALVIN ("Componing Actions from Language and Vision") fue lanzado por la Universidad de Friburgo en 2022 y responde a una pregunta diferente: ¿pueden las habilidades de una cadena de políticas que ha visto individualmente en largas secuencias especificadas por el lenguaje natural? En lugar de cientos de archivos de tareas separados, CALVIN envía un entorno de mesa compartido único con cajones, puertas correderas, bloques de colores, un LED y un botón.
El conjunto de datos es aproximadamente 24 horas de teleoperación humana distribuida en cuatro entornos visualmente distintos (A, B, C, D). El protocolo de evaluación estándar se ejecuta en uno (o un subconjunto) de los entornos y se evalúa en otro, produciendo una métrica de generalización natural de cero disparos o pocos disparos. El número de encabezado de los informes de CALVIN es el número promedio de instrucciones completadas con éxito de cinco, lo que crea un elevado gradiente de dificultad que aún no está saturado en 2026.
Calvin es también uno de los pocos puntos de referencia donde se puede ver cuánto se desploma el rendimiento a largo plazo en relación con la precisión de una sola habilidad. Las políticas que obtienen un 95 por ciento de habilidades individuales a menudo caen bajo dos instrucciones encadenadas, que es exactamente el tipo de señal que se desea cuando se prueba la memoria, la planificación o objetivos condicionados a objetivos.
Compromiso: cuándo elegir cuál
Pick LIBERO si quieres un índice de referencia rápido y de baja fricción que se conecte a Robosuite, te importa el aprendizaje permanente o continuo, quieres que tus números sean directamente comparables con el tablero de clasificación OpenVLA / Octo / pi0, o necesitas una desglose limpia por suite para una ablación. LIBERO es también la opción más fácil si ejecutas tus [ambientes de RL]
**Pick CALVIN si necesitas un razonamiento composición de largo horizonte, te importa la brecha entre el nivel de habilidad y el nivel de cadena de rendimiento, o quieres probar la imagen de objetivo o el condicionamiento de lenguaje en un entorno compartido.
Pick both si estás publicando un artículo de VLA en 2026. Se ha convertido en un requisito casi obligatorio informar números LIBERO, y las secuencias de CALVIN dan a los revisores la señal de largo horizonte que LIBERO no hace.
Computación y hardware
Los dos puntos de referencia se ejecutan en una sola GPU de consumo. LIBERO, debido a MuJoCo, está ligado a la CPU para el paso de la física y se beneficia de una CPU de 8+ núcleos cuando se despliegan muchos entornos paralelos. CALVIN se ejecuta en PyBullet, lo que hace que sea menos fácil de hacer errores paraleles pero más fácil de depurar con sondas de espacio de imagen. Ningún punto de referencia necesita una GPU de centro de datos
Para la capacitación, el panorama es diferente. La capacitación a gran escala de VLA en la parte superior de las demostraciones LIBERO o CALVIN todavía necesita 4-8 GPUs, no porque el simulador es pesado, sino porque las columnas traseras del lenguaje de visión lo son. Si usted está llevando su propia política entrenada y sólo evaluando, una sola estación de trabajo funciona. Si desea iterar en las arquitecturas de políticas, planifique para hosts multi-GPU. Nuestra [plataforma de datos]
Flujo de trabajo de recopilación de datos
Ambos conjuntos de datos fueron recogidos a través de teclado / juego de teleoperación, no VR. Esto es históricamente significativo porque mantiene los demos bajos de ruido y altamente repetible, pero también hace que la distribución de movimiento más estrecha que un conjunto de datos recogidos en VR como [BridgeData o RoboMimic]
Verificación de la realidad de las licencias
Los dos proyectos están licenciados por MIT, lo que es tan permisible como los datos académicos. Puedes entrenar políticas comerciales en cualquiera de los conjuntos de datos, redistribuir puntos de control derivados e incorporarlos en productos. Dicho esto, los assets (files de malla, mapas de textura) combinados con Robosuite y CALVIN tienen sus propias licencias; si extraes y re-hosta activos, revisa la atribución upstream. En la práctica, los equipos tratan los datos de trayectoria como MIT y los simuladores como la licencia de Robosuite o PyBullet.
Ecosistemas y herramientas en 2026
LIBERO tiene el ecosistema más grande de envolturas: LeRobot lo soporta, HuggingFace tiene varias versiones preprocesadas, y la mayoría de los repositorios VLA envían un script de evaluación LIBERO.
Resultados reportados que verá en los documentos 2026
En LIBERO, las fuertes políticas VLA de la era 2025 (OpenVLA, pi0, variantes Octo) suelen llegar al rango de éxito del 70-90 por ciento en Espacial, Objeto y Objetivo, y del 30-60 por ciento en LIBERO-100 dependiendo de la receta de entrenamiento. La diferencia es interesante: las políticas que funcionan bien en las tres primeras suites a veces caen de un acantilado en LIBERO-100, lo que revela una brecha de generalización que un solo número promedio ocultaría. Cuando lees un nuevo artículo, siempre revisa la desglose por suite en lugar de la media. Los documentos que informan solo de la media, francamente, ocultan algo.
En CALVIN, la métrica a observar es Avg. Seq. Len.
Integración con la pila LeRobot
Ambos conjuntos de datos están disponibles a través de LeRobot en forma especulada. LeRobot normaliza el esquema de trayectoria, expone una interfaz PyTorch
Veredicto
Si sólo puedes ejecutar uno, ejecutar LIBERO
Recursos relacionados en nuestro sitio web
- [Details de la base de datos LIBERO]
- [Página de referencia de Calvin]
- [Comparación abierta de X-embodiment vs DROID]
- [Comparación de BridgeData con RoboMimic]
- [Mejores conjuntos de datos de aprendizaje de robots en 2026]
- [Catálogo de VLA y modelos de política]
- [Nuestros informes de investigación]







