FlexMoGen:给 AI 动作生成配上风格参考视频
FlexMoGen:给 AI 动作生成配上"风格参考视频"
arXiv 2609.08032 · 2026-09-07一句话先说结论
用文本描述让人物动起来,是目前 AI 动作生成最常见的用法。但有个痛点:文字能告诉模型"一个人跳舞",却很难传达"跳得轻快还是沉重、节奏是干脆还是绵延"这类风格细节。今天介绍的 FlexMoGen 解决这个问题——给它一段文本描述 + 一段风格参考视频,它就能生成既符合文字意思、又还原参考视频动作风格的 3D 人物序列。这套方案来自加州大学戴维斯分校、布朗大学和 Epic Games 的联合团队,论文已于 2026 年 9 月 7 日上传 arXiv(编号 2609.08032)。
本文基于 arXiv 论文原文整理。
这件事对谁重要
- 游戏动画师:以前写一段"战斗风格挥剑"需要逐帧调整或请动捕演员,现在用参考视频做风格引导,批量出初版更省事。
- 虚拟主播 / 数字人团队:想要特定舞者的跳法但不想重新动捕,FlexMoGen 可以把风格迁移到新角色上。
- VR / 动捕替代方向的研究者:用文本 + 风格示例生成动作,减少对大量标注数据的依赖。
- 动作生成领域的研究者:无需离散风格标签就能学到连续风格空间,对多风格混合生成有启发。
核心创新:用视频片段补全文本说不清的东西
现有文生动作模型的常见做法是直接用文本提示词(如"a person dances energetically")生成动作。问题在于,文本对"节奏快慢、肢体画幅大小、力度轻重"这些风格的描述非常有限,同一句话在不同人脑子里可能对应完全不同的动作质感。
FlexMoGen 的做法是多模态风格引导:
- 输入:一段自然语言描述(规定动作"内容")+ 一段风格参考视频(规定动作"味道")
- 输出:同时满足语义要求和风格特征的连续动作序列
- 关键突破:无需预先标注的风格标签,模型通过无监督方式从视频中自动学习风格的连续表示
这意味着你不需要提前把动作归类为"欢快风格""沉稳风格"等固定标签,直接拿一段参考视频喂进去就行,模型会自动提取其中的风格特征。
关键模块拆解
1. 无监督变分风格编码器
这是 FlexMoGen 的核心设计之一。模型从参考视频片段中编码出一个风格向量,这个过程没有使用任何外部风格标签,完全靠数据驱动学习。编码器基于变分自编码器(VAE)架构,能够捕捉风格中的不确定性——同一风格下可能有多种合理的表现方式,模型输出的不是单一向量,而是一个分布,采样后可以产生多样化的风格变化。
2. 联合预训练架构
FlexMoGen 将两个组件放在同一个框架里训练:
- 风格编码器:负责从参考视频提取风格
- 文生动作潜在扩散模型:负责根据文本 + 风格条件生成动作
两者联合预训练,使得风格编码和动作生成能够相互适配,而不是分别训练后强行拼接。这种联合训练策略让模型在长序列和时变风格(即一段动作中风格逐渐变化)场景下表现更好。
3. 高效相对位置编码
传统的位置编码在长序列动作生成中容易遗忘远处的关节信息。FlexMoGen 引入了高效的相对位置编码方案,使模型能够更好地捕捉长距离的时空依赖关系,这对于生成连贯的多风格动作序列尤为重要。
能做什么 / 适合什么场景
- 文本 + 参考视频 → 风格化动作:最典型的使用方式。给定"一个人踢腿"的文本和一段街舞参考视频,生成带有街舞风格的踢腿动作。
- 多风格混合生成:由于风格编码器输出的是连续向量,理论上可以在两个风格之间插值,产生混合风格的动作。
- 时变风格生成:一段动作中,风格可以随时间变化(例如从温柔过渡到有力),模型支持这种动态风格迁移。
- 无需离散风格标签:不需要提前整理风格分类数据集,直接拿任意参考视频即可。
局限与适用边界
基于论文摘要和 arXiv 页面信息的有限了解,以下方面论文未明确提及,需谨慎解读:
- 开源状态:论文未明确说明代码是否开源,需关注后续 GitHub 动态
- 数据集规模:未提及训练数据的具体规模和来源构成
- 实时性:生成速度(推理延迟)未在摘要中披露,不适合判断是否适用于实时应用
- 多角色生成:当前工作聚焦单角色动作生成,多人交互场景未被覆盖
- 评估指标:FID 等生成质量指标、用户研究结果等详情需在完整论文中查看
本文由加装AI助手整理发布 | 数据来源:arXiv