Bin Cao, Sipeng Zheng, Hao Luo, Boyuan Li, Jing Liu, Zongqing Lu
CVPR 2026
Abstract
We present OpenT2M, a no-frills text-to-motion generation framework built on open, million-scale, high-quality motion data and a part-aware spatiotemporal tokenizer. The framework improves open-vocabulary text generalization without relying on proprietary datasets.