CALVIN: Manipulación de robots con condiciones lingüísticas de largo horizonte
Explore CALVIN: 24 horas de teleop en 34 tareas en 4 entornos con etiquetas de lenguaje natural.
Un conjunto de datos de manipulación de mesa de 24 horas en cuatro entornos con etiquetado completo en lenguaje natural
TL;DR
| Metric | Value |
|---|---|
| Task count | 34 distinct subtasks, 5-instruction evaluation chains |
| Robots | Franka Emika Panda (PyBullet simulation) |
| Modalities | RGB static + gripper cameras, depth, proprioception, language |
| License | MIT |
| Size | ~24 hours of teleop play data (~166 GB uncompressed) |
| Environments | A, B, C, D (different textures, lighting, object layouts) |
¿Qué es Calvin?
CALVIN (Componing Actions from Language and Vision) fue lanzado por la Universidad de Friburgo para probar las políticas de robots en condiciones de lenguaje en un largo horizonte. Toma una filosofía diferente de recopilación de datos de los puntos de referencia de estilo clip: en lugar de grabar una demostración por tarea etiquetada, CALVIN grabó ~24 horas de "juego" teleoperado no dirigido en un Franka Emika Panda y luego segmentó retroactivamente y etiquetó a las multitudes esas trayectorias con lenguaje natural. Esto produce tanto una densa imitación de la señal de aprendizaje como un corpus de lenguaje multi-tareas de cientos de diferentes frases de inglés por habilidad.
El referente incluye cuatro entornos (A, B, C, D) que comparten la misma geometría de la mesa, pero difieren en las texturas, la iluminación y los arreglos de los objetos articulados
Calvin es el punto de referencia de elección cuando un documento afirma "la lenguaje de largo horizonte que sigue" porque el protocolo oficial de evaluación encierra cinco instrucciones consecutivas y solo cuenta el despliegue como exitoso si las cinco subtareas terminan en orden. Ese modo de falla de composición hace que los números de CALVIN sean mucho más difíciles de saturar que los puntos de referencia de tarea única, por lo que HULC, RT-2, GR-1, y RoboFlamingo todos informan sobre él.
Cómo descargar y cargar
# Clone the benchmark
git clone --recursive https://github.com/mees/calvin.git
cd calvin && sh install.sh
# Download the full ABCD split (~166 GB)
cd dataset && sh download_data.sh ABCD
# Iterate demos in Python
from calvin_env.envs.play_table_env import get_env
from calvin_agent.datasets.npz_dataset import NpzDataset
d = NpzDataset(data_dir='dataset/task_ABCD_D/training')
print(d[0]['rgb_static'].shape, d[0]['language']['ann'])
Para la capacitación a escala, la mayoría de los equipos convierten CALVIN en formato RLDS o LeRobot para que pueda compartir un cargador de datos con Open X-Embodiment y BridgeData v2.
Casos de uso comunes y emparejamientos
- Políticas en lenguaje. HULC, HULC++, y GR-1 publican todos los números de CALVIN; es el camino más corto para demostrar una nueva política en lenguaje.
- Atulado fino de VLA. Las variantes RoboFlamingo, RT-2 y OpenVLA se ajustan a la finalidad en CALVIN para validar la base del lenguaje; la precisión de la cadena de secuencias es un buen sustituto para seguir las instrucciones de VLA.
- Plan de planificación latente / modelos mundiales. Los datos de juego no etiquetados de larga duración se utilizan con frecuencia para preparar previamente a los generadores de planes latente (LATMO, SkillMimic) antes de la especialización de tareas en aguas subyacentes.
- ** Validación de simulación a realidad.** La división de cuatro entornos permite a los investigadores separar el cambio de textura y diseño de la capacidad de manipulación real.
Indicadores de referencia y tablas de clasificación
La métrica reportada es la longitud promedio de las cadenas de instrucciones exitosas (0 a 5).







