HumanML3D: Text-zu-Motion-Generationsdaten-Set
HumanML3D: 14.616 menschliche Bewegungen mit 44.970 Textbeschreibungen. Das Standard-Benchmark für die Text-zu-Motion-Generation. MIT-Lizenz, basierend auf AMASS + HumanAct12.
14.616 Bewegungen mit 44.970 Textbeschreibungen.
MIT -- Open NPY + Textbewegungssprache
Schlüsselinformationen
| Metric | Value |
|---|---|
| Motions | 14,616 unique motion sequences |
| Text descriptions | 44,970 (avg. ~3 per motion) |
| Source | AMASS motion capture + HumanAct12 |
| Representation | 263-dim feature vector per frame (joints, velocities, foot contact) |
| License | MIT |
| Benchmark models | MDM, MotionDiffuse, MoMask, T2M-GPT, ReMoDiffuse |
Was ist HumanML3D?
HumanML3D ist der Standard-Benchmark-Datensatz für die Text-zu-Motion-Generierung. Es verbindet 14.616 menschliche Bewegungsschreiten aus dem AMASS-Bewegungsaufnahmearchiv mit 44.970 crowd-sourced-natürlichen Sprachbeschreibungen. Jede Bewegung hat etwa 3 Textbeschreibungen in natürlichem Englisch geschrieben, wie "eine Person geht langsam vorwärts und dreht sich dann nach links" oder "jemand springt dreimal an Ort und Stelle".
Die Bewegungserstellung verwendet einen 263-dimensionalen Merkmalvektor pro Rahmen, der Wurzelgeschwindigkeiten, gemeinsame Positionen, gemeinsame Geschwindigkeiten, gemeinsame Rotationen und Fußkontaktetiketten kodiert.
Relevanz für die Robotik
HumanML3D- ausgebildete Modelle ermöglichen die sprachlich bedingte Bewegungserzeugung für humanoide Roboter. Anstatt Hand-Macht Bewegung Primitive, können Ingenieure gewünschte Verhaltensweisen in der natürlichen Sprache beschreiben und Kandidaten-Trajektorien generieren. Diese Trajektorien können dann mit Standard-Retargeting-Pipelines auf bestimmte Roboter-Einführungen (Unitree G1, NVIDIA GR1, etc.) zurückgerichtet werden.







