Volver a Datasets

LIBERO vs. CALVIN: Comparación de referencia de aprendizaje de robots 2026

LIBERO vs. CALVIN en 2026: conjuntos de tareas, demostraciones, condicionamiento de lenguaje, encarnaciones y licencias comparadas. Elige el punto de referencia adecuado para el aprendizaje de robots a lo largo de la vida o a largo plazo.

LIBERO y CALVIN son dos de los puntos de referencia simulados más citados en el aprendizaje robótico moderno. Ambos se dirigen a la manipulación condicionada por el lenguaje, pero fueron diseñados con objetivos de investigación muy diferentes: LIBERO para el aprendizaje permanente y la evaluación de VLA en conjuntos de tareas discretas, CALVIN para cadenas de habilidades de largo horizonte en un entorno de mesa compartido. Si usted está eligiendo cuál de ellos debe informar los números en 2026, esta guía le da una comparación directa entre la escala, la estructura, el idioma, la realización, la computación y las licencias.

TL;DR

  • ** Aprendizaje permanente y permanente:** LIBERO es el estándar fue construido explícitamente para la evaluación de la transferencia de conocimientos en cuatro conjuntos de tareas.
  • Cadenas de lenguaje de largo horizonte: CALVIN gana su punto de venta único es la evaluación de secuencias de hasta cinco instrucciones de lenguaje en una implementación.
  • Modeles de referencia de VLA: LIBERO es más común en los documentos recientes (OpenVLA, [pi0, Octo](T2)) porque sus suites discretas son fáciles de informar.
  • Generalización de la división del medio ambiente: CALVIN gana cuatro entornos visualmente distintos (A, B, C, D) dan un protocolo de trenes/pruebas limpio fuera de la caja.
  • ** Facilidad de funcionamiento local:** LIBERO es más ligero Robosuite + MuJoCo, T0.

En un vistazo

Attribute LIBERO CALVIN
First release 2023 (NeurIPS D&B track) 2022 (RA-L)
Primary goal Lifelong learning + imitation / VLA eval Long-horizon language-conditioned manipulation
Task suites 4 suites: Spatial, Object, Goal, LIBERO-100 (Long) 34 skill classes, chained into sequences of 5
Total tasks ~130 tasks One shared environment with compositional task chains
Demostración scale Around 6500 human teleoperation demos (50 per task) ~24 hours of teleoperation across 4 environments
Simulator Robosuite / MuJoCo PyBullet (custom tabletop)
Embodiment Franka Emika Panda (7-DoF) Franka Emika Panda (7-DoF) with parallel gripper
Environment splits Per-suite train/test with held-out configurations Environments A, B, C, D for zero-shot transfer
Language labels Yes, per task Yes, crowdsourced natural language instructions
Evaluation metric Success rate per suite + forward / backward transfer Avg. sequence length successfully completed (out of 5)
License MIT MIT
Paper arXiv:2306.03310 arXiv:2112.03227

Lo que LIBERO realmente prueba

LIBERO ("Lifelong learning benchmark for robot manipulation") fue construido en la UT Austin y sus colaboradores como respuesta a una brecha en la literatura de aprendizaje por imitación: la mayoría de los benchmarks anteriores medían la calidad de la política en una distribución de tareas fija, pero muy pocos medían cómo un robot acumula y transfiere conocimientos a medida que llegan nuevas tareas. El índice de referencia se estructura en cuatro conjuntos de tareas, cada uno con alrededor de 10 tareas y 50 demostraciones de teleoperación por tarea, para un total de aproximadamente 130 tareas y 6.500 trayectorias.

Las cuatro suites son LIBERO-Spatial (los mismos objetos, diferentes relaciones espaciales), LIBERO-Object (diferentes instancias de objetos en el mismo diseño), LIBERO-Objetivo (diferentes instrucciones de objetivos con objetos compartidos) y **LIBERO-100 (Longa) **, un conjunto mucho más difícil de 100 tareas de horizonte largo extraídas de escenas realistas de cocina y sala de estar. Los tres primeros están diseñados para aislar un solo eje de desplazamiento de distribución; LIBERO-100 mezcla todo.

Lo que hace que LIBERO sea atractivo para la evaluación moderna de VLA es que la estructura de tareas discreta se asigna limpiamente al estilo de la lista de resultados. Cuando se evalúan [OpenVLA, Octo, pi0, y políticas de fundación similares]T5), los artículos típicamente informan cuatro números uno por suite más un promedio. Esto es mucho más fácil de consumir que una única puntuación de largo horizonte y ha hecho de LIBERO el conjunto de evaluaciones VLA predeterminado desde mediados de 2024.

Lo que realmente prueba CALVIN

CALVIN ("Componing Actions from Language and Vision") fue lanzado por la Universidad de Friburgo en 2022 y responde a una pregunta diferente: ¿pueden las habilidades de una cadena de políticas que ha visto individualmente en largas secuencias especificadas por el lenguaje natural? En lugar de cientos de archivos de tareas separados, CALVIN envía un entorno de mesa compartido único con cajones, puertas correderas, bloques de colores, un LED y un botón.

El conjunto de datos es aproximadamente 24 horas de teleoperación humana distribuida en cuatro entornos visualmente distintos (A, B, C, D). El protocolo de evaluación estándar se ejecuta en uno (o un subconjunto) de los entornos y se evalúa en otro, produciendo una métrica de generalización natural de cero disparos o pocos disparos. El número de encabezado de los informes de CALVIN es el número promedio de instrucciones completadas con éxito de cinco, lo que crea un elevado gradiente de dificultad que aún no está saturado en 2026.

Calvin es también uno de los pocos puntos de referencia donde se puede ver cuánto se desploma el rendimiento a largo plazo en relación con la precisión de una sola habilidad. Las políticas que obtienen un 95 por ciento de habilidades individuales a menudo caen bajo dos instrucciones encadenadas, que es exactamente el tipo de señal que se desea cuando se prueba la memoria, la planificación o objetivos condicionados a objetivos.

Compromiso: cuándo elegir cuál

Pick LIBERO si quieres un índice de referencia rápido y de baja fricción que se conecte a Robosuite, te importa el aprendizaje permanente o continuo, quieres que tus números sean directamente comparables con el tablero de clasificación OpenVLA / Octo / pi0, o necesitas una desglose limpia por suite para una ablación. LIBERO es también la opción más fácil si ejecutas tus [ambientes de RL]T6) en una computadora portátil MuJoCo es ligero, y una sola suite termina en una hora en una GPU decente.

**Pick CALVIN si necesitas un razonamiento composición de largo horizonte, te importa la brecha entre el nivel de habilidad y el nivel de cadena de rendimiento, o quieres probar la imagen de objetivo o el condicionamiento de lenguaje en un entorno compartido.

Pick both si estás publicando un artículo de VLA en 2026. Se ha convertido en un requisito casi obligatorio informar números LIBERO, y las secuencias de CALVIN dan a los revisores la señal de largo horizonte que LIBERO no hace.

Computación y hardware

Los dos puntos de referencia se ejecutan en una sola GPU de consumo. LIBERO, debido a MuJoCo, está ligado a la CPU para el paso de la física y se beneficia de una CPU de 8+ núcleos cuando se despliegan muchos entornos paralelos. CALVIN se ejecuta en PyBullet, lo que hace que sea menos fácil de hacer errores paraleles pero más fácil de depurar con sondas de espacio de imagen. Ningún punto de referencia necesita una GPU de centro de datos un RTX 4090 o incluso un 3090 es suficiente para evaluar suites completos.

Para la capacitación, el panorama es diferente. La capacitación a gran escala de VLA en la parte superior de las demostraciones LIBERO o CALVIN todavía necesita 4-8 GPUs, no porque el simulador es pesado, sino porque las columnas traseras del lenguaje de visión lo son. Si usted está llevando su propia política entrenada y sólo evaluando, una sola estación de trabajo funciona. Si desea iterar en las arquitecturas de políticas, planifique para hosts multi-GPU. Nuestra [plataforma de datos]T7) también puede descargar el almacenamiento de trayectoria y la orquestación de evaluación.

Flujo de trabajo de recopilación de datos

Ambos conjuntos de datos fueron recogidos a través de teclado / juego de teleoperación, no VR. Esto es históricamente significativo porque mantiene los demos bajos de ruido y altamente repetible, pero también hace que la distribución de movimiento más estrecha que un conjunto de datos recogidos en VR como [BridgeData o RoboMimic]T8. Los equipos que se entrenan en LIBERO o CALVIN y se implementan en hardware real a menudo necesitan aumentar con datos de teleop más diversos.

Verificación de la realidad de las licencias

Los dos proyectos están licenciados por MIT, lo que es tan permisible como los datos académicos. Puedes entrenar políticas comerciales en cualquiera de los conjuntos de datos, redistribuir puntos de control derivados e incorporarlos en productos. Dicho esto, los assets (files de malla, mapas de textura) combinados con Robosuite y CALVIN tienen sus propias licencias; si extraes y re-hosta activos, revisa la atribución upstream. En la práctica, los equipos tratan los datos de trayectoria como MIT y los simuladores como la licencia de Robosuite o PyBullet.

Ecosistemas y herramientas en 2026

LIBERO tiene el ecosistema más grande de envolturas: LeRobot lo soporta, HuggingFace tiene varias versiones preprocesadas, y la mayoría de los repositorios VLA envían un script de evaluación LIBERO.

Resultados reportados que verá en los documentos 2026

En LIBERO, las fuertes políticas VLA de la era 2025 (OpenVLA, pi0, variantes Octo) suelen llegar al rango de éxito del 70-90 por ciento en Espacial, Objeto y Objetivo, y del 30-60 por ciento en LIBERO-100 dependiendo de la receta de entrenamiento. La diferencia es interesante: las políticas que funcionan bien en las tres primeras suites a veces caen de un acantilado en LIBERO-100, lo que revela una brecha de generalización que un solo número promedio ocultaría. Cuando lees un nuevo artículo, siempre revisa la desglose por suite en lugar de la media. Los documentos que informan solo de la media, francamente, ocultan algo.

En CALVIN, la métrica a observar es Avg. Seq. Len. el número medio de instrucciones completadas en un despliegue de cinco. Los modelos fuertes de 2025 alcanzan aproximadamente 3.5-4.0 en la evaluación más fácil de A a A y caen a 2.0-3.0 en la evaluación de D de tiro cero. Cualquier cosa superior a 4.0 en D de tiro cero se considera de última generación a principios de 2026. Debido a que CALVIN utiliza una métrica de producto de éxitos, incluso pequeñas regresiones por paso se componen dramáticamente, que es precisamente la propiedad que hace de CALVIN un punto de referencia útil.

Integración con la pila LeRobot

Ambos conjuntos de datos están disponibles a través de LeRobot en forma especulada. LeRobot normaliza el esquema de trayectoria, expone una interfaz PyTorch T1, y maneja la decodificación de vídeo en pedazos. Si estás entrenando una política de difusión o política de transformador desde cero, el camino de LeRobot es la forma más rápida de consumir tanto LIBERO como CALVIN sin escribir cargadores personalizados. Para la evaluación, sin embargo, todavía se desea ejecutar el arnés de evaluación LIBERO o CALVIN original que llevan las configuraciones oficiales de tareas y los verificadores de éxito de los que dependen los tablones de clasificación.

Veredicto

Si sólo puedes ejecutar uno, ejecutar LIBERO es más barato, más rápido, más estándar en 2026 documentos, y conecta a la gama más amplia de políticas pre-entrenadas. Si tu pregunta de investigación se refiere específicamente a cadenas de lenguaje de largo horizonte, CALVIN sigue siendo único y todavía no saturado. Los equipos con presupuestos de computación ajustados deben priorizar LIBERO; los equipos que estudian políticas de planificación, memoria o jerarquía deben priorizar CALVIN. Y los equipos que se dedican a la navegación deben, después de los puntos de referencia, pasar a la recopilación de datos del mundo real.

Recursos relacionados en nuestro sitio web

  • [Details de la base de datos LIBERO]
  • [Página de referencia de Calvin]
  • [Comparación abierta de X-embodiment vs DROID]
  • [Comparación de BridgeData con RoboMimic]
  • [Mejores conjuntos de datos de aprendizaje de robots en 2026]
  • [Catálogo de VLA y modelos de política]
  • [Nuestros informes de investigación]