에고 4D: 가장 큰 에고센터 비디오 데이터 세트
에고4D: 가장 큰 에고센터 비디오 데이터 세트. 9개국 931명의 참가자로부터 3,670시간. 손 추적, 시력, 3D 스캔. 연구용만 (CC-BY-NC-4.0).
9개국 931명의 참가자로부터 3,670시간의 첫인칭 동영상
CC-BY-NC -- 비상용 MP4 + JSON ~7 TB
주요 통계
| Metric | Value |
|---|---|
| Duration | 3,670 hours of first-person video |
| Participants | 931 across 74 locations in 9 countries |
| Size | ~7 TB |
| Modalities | RGB video, audio, gaze tracking, hand tracking, 3D environment scans |
| Benchmarks | Episodic memory, hand-object interaction, AV diarization, social interaction, forecasting |
| License | CC-BY-NC-4.0 (requires registration) |
| Origin | Meta AI Research |
이고4D란 무엇인가?
이고4디는 세계 13개 대학과 연구소와 협력하여 메타 인공지능 연구소가 만든 가장 큰 이기심적인 비디오 데이터 세트입니다. 9개국 931명의 참가자들의 첫 번째 인격적인 관점에서 촬영된 요리와 쇼핑, 공예, 사회생활 등 매일 3670시간의 활동을 담고 있습니다.
다른 비디오 데이터 세트에서 구별되는 것은 그 해설의 깊다. 표준 액션 레이블을 넘어, 그것은 서사, 객체 탐지, 핸드- 객체 접촉 해설, 시선 추적, 3D 환경 스캔을 포함한다. 이것은 다섯 가지 다른 벤치마크 트랙을 가능하게 합니다. 에피소디컬 메모리 (過去の出来事の発見), 핸드-オブジェクト 상호작용, 오디오-비주얼 기기화, 사회적 상호작용 이해, 그리고 미래의 활동 예측.
로봇 과학자들이 왜 신경쓰는지
Ego4D는 사용 가능한 가장 광범위한 자기중심적인 손-물질 상호작용 데이터 소스를 제공합니다. 로봇에 대해서는 로봇이 따라할 수 있는 인간 조작 전략에 대한 더 나은 이해, 행동 예측 모듈을 위한 훈련 데이터 및 포착 탐지 및 접촉 예측을 위한 시각적 전개에 관한 것입니다. 최근 VLA 모델들은 시각 코더를 미리 훈련시키기 위해 Ego4D에서 파생된 기능을 사용합니다.
접근
** 참고:** Ego4D는 등록이 필요하며 CC-BY-NC-4.0 라이센스 (무역용 사용만) 이다.







