Datasetsに戻る

HumanML3D:テキストからモーション生成データセット

HumanML3D: 14,616 人の動きと 44,970 のテキスト記述.テキストから動きへの生成のための標準基準. MIT ライセンス,AMASS + HumanAct12 に基づいて構築.

言語条件付きの動き生成のための標準基準です MITのライセンスで

MIT -- オープンNPY +テキスト・モーション言語

重要な統計

Metric Value
Motions 14,616 unique motion sequences
Text descriptions 44,970 (avg. ~3 per motion)
Source AMASS motion capture + HumanAct12
Representation 263-dim feature vector per frame (joints, velocities, foot contact)
License MIT
Benchmark models MDM, MotionDiffuse, MoMask, T2M-GPT, ReMoDiffuse

HumanML3Dとは何か?

HumanML3Dはテキストからモーション生成のための標準基準データセットです.AMASSモーションキャプチャアーカイブから14.616人の人間の動きシーケンスをクラウドソース自然言語説明44,970と組み合わせます.それぞれの動きには自然英語で書かれた約3つのテキスト説明があります.例えば"人ゆっくり進んで左に曲がりくると"または"誰かが3回ジャンプします".

運動表現は,根速度,関節位置,関節速度,関節回転,足接触ラベルをコードするフレームごとに263次元特性のベクトルを使用している.このコンパクト表現はテキスト-トゥ-ムーブメント研究コミュニティの事実上の標準となっています.

ロボット学への関連性

HumanML3D訓練されたモデルは,ヒューマノイドロボットのための言語条件の動き生成を可能にします.手作りの動き原始的なものではなく,エンジニアは自然言語で望ましい行動を記述し,候補軌道を生成することができます.これらの軌跡は標準的なリターゲティングパイプラインを使用して特定のロボット実施形態 (Unitree G1,NVIDIA GR1,など) に再ターゲット化することができます.

アクセス

[GitHubからダウンロード] T0] [紙 (arXiv) ]