Ego4D: El conjunto de datos de video egocéntrico más grande
Ego4D: el conjunto de datos de vídeo egocéntrico más grande. 3.670 horas de 931 participantes en 9 países. Seguimiento de manos, mirada, escáneres 3D. Solo para investigación (CC-BY-NC-4.0).
3,670 horas de video en primera persona de 931 participantes en 9 países.
CC-BY-NC -- MP4 no comercial + JSON ~7 TB
Información clave
| Metric | Value |
|---|---|
| Duration | 3,670 hours of first-person video |
| Participants | 931 across 74 locations in 9 countries |
| Size | ~7 TB |
| Modalities | RGB video, audio, gaze tracking, hand tracking, 3D environment scans |
| Benchmarks | Episodic memory, hand-object interaction, AV diarization, social interaction, forecasting |
| License | CC-BY-NC-4.0 (requires registration) |
| Origin | Meta AI Research |
¿Qué es Ego4D?
Ego4D es el conjunto de datos de vídeo más grande creado por Meta AI Research en colaboración con 13 universidades y laboratorios de todo el mundo. Captura 3,670 horas de actividades diarias - cocinar, comprar, hacer artesanías, socializar - filmadas desde la perspectiva de 931 participantes en 9 países.
Lo que distingue a Ego4D de otros conjuntos de datos de video es la profundidad de sus anotaciones. Más allá de las etiquetas de acción estándar, incluye narraciones, detecciones de objetos, anotaciones de contacto de objetos a mano, seguimiento de la mirada y escaneos de entorno 3D. Esto permite cinco pistas de referencia distintas: memoria episódica (encontrar eventos pasados), interacción entre objetos de mano, diarización audiovisual, comprensión de la interacción social y previsión de actividades futuras.
¿Por qué se preocupan los robóticos
Ego4D proporciona la fuente más extensa de datos de interacción entre manos y objetos egocéntricos disponibles. Para la robótica, esto se traduce en: una mejor comprensión de las estrategias de manipulación humana que los robots pueden imitar, datos de entrenamiento para módulos de anticipación de acción y antecedentes visuales para la detección de agarre y predicción de contacto. Varios modelos VLA recientes utilizan características derivadas de Ego4D para la pre-entrenamiento de sus codificadores visuales.
Acceso
Nota: Ego4D requiere registro y tiene licencia CC-BY-NC-4.0 (solo para uso no comercial).







