AI编舞

Open-UniMo:让 AI 既能"看懂"动作,也能"做出"动作

2026年9月16日5 次阅读
Open-UniMo:让 AI 既能"看懂"动作,也能"做出"动作

统一动作-语言大模型:15 万词表装下文字和动作,双向打通理解与生成

AI动作生成

一项 9 月 13 日在 arXiv 公开的新研究提出了 Open-UniMo——一个统一的大型动作-语言模型(LMLM):它在经典开源大语言模型 Qwen 的约 15 万文本词表基础上,额外扩展了 6.4 万个"动作 token",让文字和动作共享同一套"词汇表",从而在同一模型里同时完成两件事:看懂一段人体动作并描述它,以及根据一句话生成连贯的人体动作。研究团队用百万级开放世界动作-语言数据训练,并配套发布了评测基准 Open-MoBench。

这件事对谁重要

🦿
具身智能开发者机器人既要理解人的动作也要生成自己的动作,双向统一模型是刚需
🧍
数字人 / 动画团队一句话直接生成动作,动作素材检索与标注也能自动化
🗂️
动捕数据从业者模型能"看懂"动作并转成文字,动作库整理、搜索、描述一步到位
🔬
多模态研究者"模态平权 + 思维链 + 强化学习"的训练路线值得借鉴

问题出在哪:动作成了语言的"附属品"

把动作和语言放进一个模型里,听起来简单,做起来难。现有的动作-语言模型大多是"语言模型带个动作插件":动作被当作语言的附属模态,模型内部还是文本说了算,动作和文字之间缺乏真正的深度交互。

另一个坑出在生成方式上。语言模型惯用的"逐个 token 往外蹦"的自回归范式,用在动辄几百帧的长动作序列上并不合适——生成越久,误差越攒越多,动作到后半段就走形了。

🧩 结果就是"偏科" 模型描述动作时语焉不详,生成动作时越生成越乱——理解和生成互相拖后腿。

Open-UniMo 怎么做:让动作和文字平起平坐

Open-UniMo 的核心思路可以拆成四步:

  1. 词表扩容,模态平权在 Qwen 约 150K 文本 token 词表上新增 64K 动作 token,动作和文字进入同一个 token 空间,动作不再是二等公民
  2. 动作版思维链引入"动作一致性思维链"(motion-consistent CoT)作为中间表示,先在语言层面推理出动作该有的语义与结构,再落到动作 token 上,桥接语言语义和动作动态
  3. 两阶段训练先用监督微调(SFT)建立思维链引导的双向动作-语言映射,再用组相对策略优化(GRPO)强化语义对齐,同时抑制自回归生成中的误差累积
  4. 自建基准检验配套发布 Open-MoBench,用视觉语言模型辅助评测三件事:文生动作(T2M)、动作生文(M2T)、以及双向一致性

实验结果显示,Open-UniMo 在常规指标和 Open-MoBench 上都达到了当时的最优水平。更有意思的是消融实验的发现:动作理解能力并不是主要受限于动作词表大小,而是把"动作生文"和可学习的"文生动作"耦合起来训练,跨模态表征反而更强——也就是说,学会生成,反过来促进了理解。

💡 为什么"统一"值得做 单做文生动作的模型只会"输出",单做动作理解的模型只会"输入";统一模型里两条能力互相促进,这正是语言模型领域"理解与生成一体"经验在动作模态上的复刻。

能用在哪

从应用角度看:给机器人或数字人配的动作指令系统——说一句话就让角色做出对应动作,还能反过来解释它看到的动作;动作数据库管理——自动为海量动捕片段生成文字描述、支持自然语言搜索;动作数据合成——为下游训练批量生成带语义标注的动作数据。

局限与适用边界

  • 目前是研究工作,论文未提供可直接调用的产品或开源工具包
  • 评测依赖 VLM 引导的自建基准,与真实生产管线的差距需实践检验
  • 百万级开放世界数据的质量与覆盖面,直接决定模型在细分动作类型上的表现

📎 来源说明

本文基于公开论文页面信息整理,并参考多家论文索引与日报站点对该工作的收录报道:

本文为基于公开论文信息的研究动态整理(部分背景信息基于多家媒体与论文索引转述整理),Open-UniMo 为学术研究工作,尚未推出面向公众的产品。文中技术细节以论文原文为准。

评论

0 条已公开
登录或注册后可以参与评论。

正在加载评论...