返回Datasets

人文ML3D:文字到动作生成数据集

人类ML3D: 14,616个人类运动,有 44,970个文本描述.文本到运动生成的标准基准. MIT许可,基于AMASS + HumanAct12.

语言条件的运动生成标准标准. MIT许可.

开放式 NPY + 文字动作语言

关键数据

Metric Value
Motions 14,616 unique motion sequences
Text descriptions 44,970 (avg. ~3 per motion)
Source AMASS motion capture + HumanAct12
Representation 263-dim feature vector per frame (joints, velocities, foot contact)
License MIT
Benchmark models MDM, MotionDiffuse, MoMask, T2M-GPT, ReMoDiffuse

人ML3D是什么?

人类ML3D是文本到运动生成的标准基准数据集.它将AMASS运动捕获档案中的14.616个人类运动序列与44,970个人群来源的自然语言描述结合起来.每个运动以自然英语写约3个文本描述,例如"一个人慢慢走向前,然后转向左"或"有人跳到位三次".

运动表示使用每个框架的263维特征向量,编码根速度,关节位置,关节速度,关节旋转和脚接触标签.这种紧的表示已成为文本到运动研究社区的实际标准.

对机器人技术的相关性

人ML3D训练模型使人形机器人能够使用语言来生成动作.而不是手工制作动作原始物,工程师可以用自然语言描述所需的行为并生成候选轨迹.这些轨迹可以通过使用标准的重定管道重新定向到特定的机器人实施 (Unitree G1,NVIDIA GR1,等).

访问

现在,我们需要一个新的技术.