AI编舞

DynaConTalk:让数字人说话时「手舞足蹈」更像人,小波扩散拆解动作节奏

2026年10月10日0 次阅读
DynaConTalk:让数字人说话时「手舞足蹈」更像人,小波扩散拆解动作节奏
AI 数字人告别「木偶感」:把动作按快慢节奏分层生成,长时说话动作不再糊成一团
AI编舞 · 动作生成

> AI 数字人张嘴说话已经很容易,但说话时身体像根木头、手势僵硬得像木偶,一直是虚拟主播和数字人视频的老大难。10 月 7 日提交到 arXiv 的 DynaConTalk 框架换了个思路:把人的动作按「快慢节奏」拆开分层生成——慢速的躯干姿态、中频的手势、快速的手指和表情细节各管各的,让长时说话动作不再糊成一团。

这是什么

DynaConTalk 是一个全身共语 3D 动作生成框架——输入一段语音,输出说话人完整的 3D 身体动作,包括躯干姿态、手势,还有手指和面部细节。「共语」(co-speech)说的就是「跟着 speech 一起动」这件事:真人说话时从来不是只动嘴,耸肩、摆手、点头都是表达的一部分。

现有模型的问题在于「平均化」。论文指出了两个老大难:

  • 动作糊:坐标空间里的扩散模型把慢速身体姿态、中频手势、快速手指/面部细节压在一个预测目标里,出来的动作低方差、过度平滑——也就是大家熟悉的「木偶感」;
  • 语音信号被稀释:固定权重的多模态融合里,密集的节奏和声学线索容易盖过稀疏但关键的内容信息,导致动作和「说了什么」对不上。

怎么做到的

DynaConTalk 的核心是一招:把扩散模型搬进小波系数空间。

它先用平稳小波变换(SWT)把动作序列拆成一组时间对齐的频率带——低频带管慢速的身体大姿态,中频带管手势「笔画」,高频带管手指和表情的快速细节——然后在这些频带系数上做扩散生成。这样做有两个直接好处:

  1. 不同速度的动作不再互相「拖平均」,慢动作依然沉稳,快细节依然干脆;
  2. 天然支持长时生成和分层可控——想调整手势风格就动对应频带,不用重生成全身。

框架还针对「节奏压过内容」的融合问题做了约束设计,让动作既踩得住语音的节奏,也跟得上说话的内容。

同期动态:动作生成开始学「演戏」

同周还有一篇值得关注的动作生成论文:Controllable Exaggeration(arXiv 2610.12316,10 月 8 日提交),来自 Ubisoft La Forge 背景的团队。它把专业动画师天天挂在嘴边的「夸张(Exaggeration)原则」正式搬进了生成模型:通过训练期适配和推理期引导,让模型生成的角色动作不仅物理上站得住,还能像动画师做出来的那样「有戏」、有表现力。

两部工作指向同一个趋势:动作生成正在从「动得对」走向「动得好」。

对谁有用

  • 数字人/虚拟主播团队:长时直播、口播视频里的肢体语言能明显摆脱「木偶感」;
  • 动画与视频制作:从语音直接生成带表演感的角色动作初稿;
  • 动作生成研究者:小波域扩散、分层频带控制是可复用的技术思路。

提醒

两项都是研究论文,目前代码和模型均未开源;效果描述来自论文自报评测,实际体验要等可复现后验证。

参考来源

  • DynaConTalk 论文页:<https://arxiv.org/abs/2610.09846>(2026-10-07 提交)
  • Controllable Exaggeration 论文页:<https://arxiv.org/abs/2610.12316>(2026-10-08 提交)

本文基于公开论文信息整理。

评论

0 条已公开
登录或注册后可以参与评论。

正在加载评论...