Open-UniMo:让 AI 既能"看懂"动作,也能"做出"动作
统一动作-语言大模型:15 万词表装下文字和动作,双向打通理解与生成
AI动作生成一项 9 月 13 日在 arXiv 公开的新研究提出了 Open-UniMo——一个统一的大型动作-语言模型(LMLM):它在经典开源大语言模型 Qwen 的约 15 万文本词表基础上,额外扩展了 6.4 万个"动作 token",让文字和动作共享同一套"词汇表",从而在同一模型里同时完成两件事:看懂一段人体动作并描述它,以及根据一句话生成连贯的人体动作。研究团队用百万级开放世界动作-语言数据训练,并配套发布了评测基准 Open-MoBench。
这件事对谁重要
问题出在哪:动作成了语言的"附属品"
把动作和语言放进一个模型里,听起来简单,做起来难。现有的动作-语言模型大多是"语言模型带个动作插件":动作被当作语言的附属模态,模型内部还是文本说了算,动作和文字之间缺乏真正的深度交互。
另一个坑出在生成方式上。语言模型惯用的"逐个 token 往外蹦"的自回归范式,用在动辄几百帧的长动作序列上并不合适——生成越久,误差越攒越多,动作到后半段就走形了。
Open-UniMo 怎么做:让动作和文字平起平坐
Open-UniMo 的核心思路可以拆成四步:
- 词表扩容,模态平权在 Qwen 约 150K 文本 token 词表上新增 64K 动作 token,动作和文字进入同一个 token 空间,动作不再是二等公民
- 动作版思维链引入"动作一致性思维链"(motion-consistent CoT)作为中间表示,先在语言层面推理出动作该有的语义与结构,再落到动作 token 上,桥接语言语义和动作动态
- 两阶段训练先用监督微调(SFT)建立思维链引导的双向动作-语言映射,再用组相对策略优化(GRPO)强化语义对齐,同时抑制自回归生成中的误差累积
- 自建基准检验配套发布 Open-MoBench,用视觉语言模型辅助评测三件事:文生动作(T2M)、动作生文(M2T)、以及双向一致性
实验结果显示,Open-UniMo 在常规指标和 Open-MoBench 上都达到了当时的最优水平。更有意思的是消融实验的发现:动作理解能力并不是主要受限于动作词表大小,而是把"动作生文"和可学习的"文生动作"耦合起来训练,跨模态表征反而更强——也就是说,学会生成,反过来促进了理解。
能用在哪
从应用角度看:给机器人或数字人配的动作指令系统——说一句话就让角色做出对应动作,还能反过来解释它看到的动作;动作数据库管理——自动为海量动捕片段生成文字描述、支持自然语言搜索;动作数据合成——为下游训练批量生成带语义标注的动作数据。
局限与适用边界
- 目前是研究工作,论文未提供可直接调用的产品或开源工具包
- 评测依赖 VLM 引导的自建基准,与真实生产管线的差距需实践检验
- 百万级开放世界数据的质量与覆盖面,直接决定模型在细分动作类型上的表现
📎 来源说明
本文基于公开论文页面信息整理,并参考多家论文索引与日报站点对该工作的收录报道:
- Open-UniMo: Towards Unified Motion-Language Understanding and Generation in the Open World(arXiv 2609.14615,2026-09-13 提交):arxiv.org/abs/2609.14615
- arXiv HTML 全文:arxiv.org/html/2609.14615v1
- Pith Review 论文索引:pith.science/paper/2609.14615
- 第三方论文日报收录:github.com/Ailing-cao/ChatDailyPapers#19