エゴ4D: 最大のエゴ中心的なビデオデータセット
Ego4D:最大のエゴ中心的なビデオデータセット. 9カ国 931人の参加者から 3,670時間. 手の追跡,目線,3Dスキャン. 研究用のみ (CC-BY-NC-4.0).
9カ国 931人の参加者の3万670時間目のファーストパーソナルビデオを メタAI研究から
CC-BY-NC -- 非商業的なMP4 + JSON ~7TB
重要な統計
| Metric | Value |
|---|---|
| Duration | 3,670 hours of first-person video |
| Participants | 931 across 74 locations in 9 countries |
| Size | ~7 TB |
| Modalities | RGB video, audio, gaze tracking, hand tracking, 3D environment scans |
| Benchmarks | Episodic memory, hand-object interaction, AV diarization, social interaction, forecasting |
| License | CC-BY-NC-4.0 (requires registration) |
| Origin | Meta AI Research |
Ego4Dとは何か?
エゴ4Dは これまで最大のエゴ中心的なビデオデータセットです 世界13の大学とラボと協力してメタAI研究が作成しました 9カ国 931人の参加者の第一人目視点から撮影された 料理,ショッピング,工芸,社交など 3670時間の日常活動を記録しています
Ego4Dを他のビデオデータセットから区分するのは,注釈の深さである.標準アクションラベルを超えて,物語,オブジェクト検出,手対オブジェクト接触注釈,目線追跡,および3D環境スキャンが含まれています. これは5つの異なる基準トラックを可能にします:エピソード記憶 (過去の出来事を見つけること),手とオブジェクトの相互作用,オーディオビジュアル日記化,社会的相互作用理解,将来の活動の予測.
ロボット学者はなぜ気になるのか
Ego4Dは,利用可能な最も広範なエゴ中心的な手とオブジェクトの相互作用データ源を提供している.ロボットにとって,これはロボットが模倣できる人間の操作戦略をよりよく理解し,アクション予期モジュールのためのトレーニングデータ,把握検出および接触予測のための視覚上の先駆者への翻訳です. 最近のVLAモデルでは,視覚エンコードを予備訓練するために Ego4Dから派生した機能を使用しています.
アクセス
注: Ego4Dは登録が必要で,CC-BY-NC-4.0ライセンス (非商業用のみ) がある.
[ego4d-data.orgで登録する]







