Zurück zu Datasets

HumanML3D: Text-zu-Motion-Generationsdaten-Set

HumanML3D: 14.616 menschliche Bewegungen mit 44.970 Textbeschreibungen. Das Standard-Benchmark für die Text-zu-Motion-Generation. MIT-Lizenz, basierend auf AMASS + HumanAct12.

14.616 Bewegungen mit 44.970 Textbeschreibungen.

MIT -- Open NPY + Textbewegungssprache

Schlüsselinformationen

Metric Value
Motions 14,616 unique motion sequences
Text descriptions 44,970 (avg. ~3 per motion)
Source AMASS motion capture + HumanAct12
Representation 263-dim feature vector per frame (joints, velocities, foot contact)
License MIT
Benchmark models MDM, MotionDiffuse, MoMask, T2M-GPT, ReMoDiffuse

Was ist HumanML3D?

HumanML3D ist der Standard-Benchmark-Datensatz für die Text-zu-Motion-Generierung. Es verbindet 14.616 menschliche Bewegungsschreiten aus dem AMASS-Bewegungsaufnahmearchiv mit 44.970 crowd-sourced-natürlichen Sprachbeschreibungen. Jede Bewegung hat etwa 3 Textbeschreibungen in natürlichem Englisch geschrieben, wie "eine Person geht langsam vorwärts und dreht sich dann nach links" oder "jemand springt dreimal an Ort und Stelle".

Die Bewegungserstellung verwendet einen 263-dimensionalen Merkmalvektor pro Rahmen, der Wurzelgeschwindigkeiten, gemeinsame Positionen, gemeinsame Geschwindigkeiten, gemeinsame Rotationen und Fußkontaktetiketten kodiert.

Relevanz für die Robotik

HumanML3D- ausgebildete Modelle ermöglichen die sprachlich bedingte Bewegungserzeugung für humanoide Roboter. Anstatt Hand-Macht Bewegung Primitive, können Ingenieure gewünschte Verhaltensweisen in der natürlichen Sprache beschreiben und Kandidaten-Trajektorien generieren. Diese Trajektorien können dann mit Standard-Retargeting-Pipelines auf bestimmte Roboter-Einführungen (Unitree G1, NVIDIA GR1, etc.) zurückgerichtet werden.

Zugriff

Download von GitHub Papier (arXiv)