인문ML3D: 텍스트에서 동작으로 생성되는 데이터 세트
인문ML3D: 44,970개의 텍스트 설명과 함께 14,616개의 인적 움직임. 텍스트에서 동작으로 생성하는 표준 기준. MIT 라이선스, AMASS + HumanAct12에 기반을 둔
14,616개의 문헌 설명과 44,970개의 문헌 설명이 있습니다. 언어 조건의 동작 생성 표준 기준입니다. MIT 라이선스
MIT -- 오픈 NPY + 텍스트 모션 언어
주요 통계
| Metric | Value |
|---|---|
| Motions | 14,616 unique motion sequences |
| Text descriptions | 44,970 (avg. ~3 per motion) |
| Source | AMASS motion capture + HumanAct12 |
| Representation | 263-dim feature vector per frame (joints, velocities, foot contact) |
| License | MIT |
| Benchmark models | MDM, MotionDiffuse, MoMask, T2M-GPT, ReMoDiffuse |
인문ML3D란 무엇인가?
인문ML3D는 텍스트에서 움직임으로 생성하는 표준 벤치마크 데이터 세트입니다. AMASS 움직임 캡처 아카이브에서 14,616 개의 인적 움직임 순서를 44,970 개의 대중적 원천 자연어 설명과 결합합니다. 각 움직임은 자연 영어로 작성된 약 3 개의 텍스트 설명이 있습니다. 예를 들어 "사람은 천천히 앞으로 걸어다가 왼쪽으로 돌립니다". 또는 "누군가가 세 번 뛰어납니다".
운동 표현은 각 프레임에 263차원 특징 벡터를 사용하여 뿌리 속도, 관절 위치, 관절 속도, 관절 회전 및 발 접촉 레이블을 암호화합니다. 이 콤팩트 표현은 텍스트-이동 연구 커뮤니티의 실질적인 표준이되었습니다.
로봇 기술에 대한 관련성
인문ML3D 훈련된 모델은 인문형 로봇의 언어 조건의 동작 생성을 가능하게 한다. 손으로 동작 원시물을 만드는 대신 엔지니어는 자연어로 원하는 행동을 설명하고 후보 궤도를 생성할 수 있다. 이 궤도는 표준 리터지팅 파이프라인을 사용하여 특정 로봇 실시예 (Unitree G1, NVIDIA GR1, 등) 로 재목표될 수 있다.







