BridgeData V2: el Corpus de Manipulación Escalable de Berkeley
Descarga BridgeData V2: 60,096 WidowX trayectorias en 24 entornos y 13 habilidades. Entrenamiento de políticas en lenguaje y generalización de referencia en menos de 1 día.
Una guía para practicantes de BridgeData V2
TL;DR
| Metric | Value |
|---|---|
| Task count | 13 skills across ~100 task variants |
| Robots | WidowX 250 6DOF arm (consumer-grade, ~$6K) |
| Modalities | RGB-D (Intel RealSense), proprioception, gripper, language instruction |
| License | CC-BY 4.0 |
| Size | 60,096 trajectories, ~400 GB raw |
| Environments | 24 scenes including toy kitchens, sinks, and tabletops |
¿Qué es BridgeData V2?
BridgeData V2 es el sucesor del lanzamiento original de BridgeData de 2021 del Laboratorio de Inteligencia Artificial y Aprendizaje Robótico (RAIL) de la UC Berkeley. Fue construido por Homer Walke, Pranav Atreya y coautores bajo la dirección de Sergey Levine para responder a una pregunta engañosamente simple: ¿puede una sola política de manipulación aprender a seguir instrucciones de lenguaje natural en docenas de entornos y habilidades, sin ningún ajuste específico del entorno? Para responder a ello, el equipo de RAIL teleoperó un brazo WidowX 250 6DOF de bajo costo en 24 escenas para 60.096 demostraciones, cubriendo la selección y ubicación, empujando, barrendo, apilar, plegando, abriendo cajones y varias otras habilidades.
Dos decisiones de diseño tomadas por BridgeData V2 tuvieron una influencia desproporcionada. Primero, cada trayectoria está anotada con una instrucción de lenguaje natural crowdsourced
BridgeData V2 es ahora una de las mayores contribuciones individuales a la mezcla Open X-Embodiment, y es el objetivo de ajuste fino más popular para los documentos que desean demostrar resultados del mundo real sin tener hardware industrial.
Cómo descargar y cargar
El conjunto de datos se distribuye como fragmentos NumPy de Berkeley y como RLDS en Google Cloud Storage a través del cubo de Open X-Embodiment:
# Raw NumPy shards (~400 GB)
wget -r https://rail.eecs.berkeley.edu/datasets/bridge_release/data/demos_8_17.zip
unzip demos_8_17.zip
# Or stream the RLDS copy from OXE (recommended for VLA training)
pip install tensorflow_datasets
import tensorflow_datasets as tfds
ds = tfds.load("bridge", data_dir="gs://gresearch/robotics", split="train")
for ep in ds.take(1):
for step in ep["steps"]:
print(step["observation"]["image_0"].shape,
step["observation"]["state"].shape,
step["action"].shape,
step["language_instruction"])
# Install the reference training stack
git clone https://github.com/rail-berkeley/bridge_data_v2.git
cd bridge_data_v2 && pip install -e .
Para ajustar bien OpenVLA o Octo, apunta la configuración a
Casos de uso comunes y emparejamientos de modelos
- Evaluación de VLA de bajo costo. BridgeData V2 es el ajuste de la realidad por defecto para OpenVLA y Octo
cualquier nuevo VLA debe publicar los números de Bridge para ser tomado en serio. - Políticas con condiciones lingüísticas. Las anotaciones de instrucciones en forma libre hacen que sea el conjunto de datos de referencia para la investigación que sigue las instrucciones.
- ** Estudios de generalización.** Debido a que la misma habilidad se repite en 24 entornos, es fácil mantener escenas y medir la generalización de escenas de tiro cero.
- Líneas de base de la política de difusión. Los ~ 4.000 episodios por capacitación se aplican de forma limpia a las políticas de difusión y transformador sin trucos de currículo.
Indicadores de referencia y tablas de clasificación
La evaluación de BridgeData V2 se informa generalmente como tasa de éxito en distribución en un conjunto de instrucciones de lenguaje prolongado, más éxito fuera de distribución en un conjunto de combinaciones de objetos / escenas novedosas. OpenVLA informa aproximadamente 70% de éxito en distribución y 40-50% de éxito OOD. Ver los Papers with Code BridgeData V2 entry y la Página de proyecto del laboratorio de RAIL para el protocolo de evaluación canónica.
Inmersión técnica profunda: esquema y espacio de acción
Los episodios de BridgeData V2 se almacenan como directorios por trayectoria, cada uno conteniendo un pickle de observaciones de Python más marcos RGB por paso y una instrucción de lenguaje. Las observaciones se registran a 5 Hz (la velocidad de bucle de teleoperación de WidowX) e incluyen dos flujos RGB
Las acciones son de 7 dimensiones: posición del delta cartesiano de efecto final (xyz), orientación del delta cartesiano (rpy), y el agarre abierto/cerrado. Debido a que la frecuencia de acción es sólo 5 Hz, las políticas de BridgeData V2 se entrenan con un desglose de acción de 4-8 pasos, lo que se alinea bien con el tamaño estándar de la política de difusión. La baja tasa de control es una bendición para la recopilación de datos (los teleoperadores alcanzan tasas de éxito más altas a velocidades lentas) y una leve maldición para tareas dinámicas (el conjunto de datos no es adecuado para cualquier cosa que requiera un control reactivo sub-100ms).
Las instrucciones de lenguaje se reciben a través de Amazon Mechanical Turk. Los trabajadores observaron cada trayectoria y escribieron una descripción en lenguaje natural de la tarea, lo que significa que las instrucciones incluyen errores de escritura, sinónimos y paráfrases. Este ruido es en realidad una característica.
Las limitaciones conocidas
- Una sola realización. Todas las trayectorias de 60K se encuentran en una WidowX 250.
- Preciencia de la mesa. Las escenas son casi todas mesas de altura de fregadero, estufa o escritorio.
- Baja velocidad de acción. 5 Hz es adecuado para la manipulación cuasiestática, pero insuficiente para tareas dinámicas como el derramamiento o la captura.
- Las etiquetas de éxito son heurísticas. El juicio del teleoperador fue la verdad fundamental para el éxito; una pequeña fracción de los episodios etiquetados como exitosos son en realidad fracasos parciales.
Las preguntas frecuentes
¿Necesito un WidowX para usar BridgeData V2? Sólo si quieres hacer una evaluación en circuito cerrado en el mundo real.
** ¿Cómo se relaciona BridgeData V2 con BridgeData V1?** V2 es aproximadamente 4 veces más grande, agrega 12 nuevas escenas, re-teleopera la mayoría de las tareas de V1 con una configuración más limpia y envía anotaciones de lenguaje en cada episodio (V1 las tenía solo en un subconjunto).
** ¿Puedo combinar BridgeData V2 con mis propios datos WidowX?** Sí







