HumanML3D:テキストからモーション生成データセット
HumanML3D: 14,616 人の動きと 44,970 のテキスト記述.テキストから動きへの生成のための標準基準. MIT ライセンス,AMASS + HumanAct12 に基づいて構築.
言語条件付きの動き生成のための標準基準です MITのライセンスで
MIT -- オープンNPY +テキスト・モーション言語
重要な統計
| Metric | Value |
|---|---|
| Motions | 14,616 unique motion sequences |
| Text descriptions | 44,970 (avg. ~3 per motion) |
| Source | AMASS motion capture + HumanAct12 |
| Representation | 263-dim feature vector per frame (joints, velocities, foot contact) |
| License | MIT |
| Benchmark models | MDM, MotionDiffuse, MoMask, T2M-GPT, ReMoDiffuse |
HumanML3Dとは何か?
HumanML3Dはテキストからモーション生成のための標準基準データセットです.AMASSモーションキャプチャアーカイブから14.616人の人間の動きシーケンスをクラウドソース自然言語説明44,970と組み合わせます.それぞれの動きには自然英語で書かれた約3つのテキスト説明があります.例えば"人ゆっくり進んで左に曲がりくると"または"誰かが3回ジャンプします".
運動表現は,根速度,関節位置,関節速度,関節回転,足接触ラベルをコードするフレームごとに263次元特性のベクトルを使用している.このコンパクト表現はテキスト-トゥ-ムーブメント研究コミュニティの事実上の標準となっています.
ロボット学への関連性
HumanML3D訓練されたモデルは,ヒューマノイドロボットのための言語条件の動き生成を可能にします.手作りの動き原始的なものではなく,エンジニアは自然言語で望ましい行動を記述し,候補軌道を生成することができます.これらの軌跡は標準的なリターゲティングパイプラインを使用して特定のロボット実施形態 (Unitree G1,NVIDIA GR1,など) に再ターゲット化することができます.
アクセス
[GitHubからダウンロード]







