语音模型

腾讯混元开源 AuK:一个 1.5B 模型,从零样本 TTS 到音频编辑全能覆盖

2026年9月14日1 次阅读
腾讯混元开源 AuK:一个 1.5B 模型,从零样本 TTS 到音频编辑全能覆盖

腾讯混元联合上海交通大学、上海创新研究院,于 2026 年 9 月开源了 AuK —— 一个 1.5B 参数的语音生成与编辑基础模型。采用 MIT 协议,支持从零样本语音合成(TTS)到内容编辑、情感转换、音频分离等十余种语音任务,统一自然语言指令接口。

这是什么?

AuK 是腾讯混元在语音领域的开源基础模型,参数量 1.5B,主打"一个模型,多种任务"。它不仅能做语音合成(TTS),还能在同一个框架下完成音色克隆、内容编辑、声学调整、情感切换、音频增强和多人语音分离等任务。

官方提供了两个版本:

  • AuK(完整版):1.5B 参数,追求最佳质量
  • AuK-Flash(快速版):蒸馏后的 4 步快速推理版本,速度更快,适合实时场景

所有任务共用同一套自然语言指令格式——你只需要用一句话描述想要什么,模型就能执行对应操作。

为什么值得注意?

在此之前,国产开源语音模型的格局主要由几个方向分割:Whisper 系列专注语音识别,VALL-E 系列偏重语音克隆,而像 Coqui 这样的项目则试图做通用 TTS。没有一个开源模型能同时覆盖从生成到编辑的完整链条。

AuK 的出现改变了这个局面。它用单一架构统一了语音生成的多种下游任务,这对开发者尤其有价值——不再需要拼凑多个模型来完成"生成 → 编辑 → 增强 → 分离"的全流程。

另一个亮点是开源:MIT 协议意味着你可以在任何场景下自由使用、修改甚至商用,这对学术研究、创业公司和独立开发者都非常友好。

支持哪些能力?

| 任务 | 说明 |

|------|------|

| 零样本 TTS | 只给文本,无需训练数据即可生成语音 |

| 音色克隆 | 用一段参考音频克隆任意人的声音 |

| 音色设计 | 不依赖真实音频,设计全新的虚拟音色 |

| 内容编辑 | 修改语音中的文字内容,保持音色不变 |

| 声学编辑 | 调整语速、语调、风格,不改变文字 |

| 情感转换 | 同一段语音切换不同情绪表达(高兴、悲伤、愤怒等) |

| 音频增强 | 去除背景噪音,提升清晰度 |

| 多人语音分离 | 从混合音频中提取单个说话人的声音 |

如何使用?

ComfyUI 集成

官方已发布 ComfyUI 节点,你可以直接在 Stable Diffusion 生态的 ComfyUI 工作流中加入 AuK,实现图像 → 语音 → 编辑的一站式生成。社区已有示例工作流可供参考。

Hugging Face 下载

模型权重已在 Hugging Face 上开放,可以直接下载推理:

```

https://huggingface.co/tencent/AuK # 完整版

https://huggingface.co/tencent/AuK-Flash # 快速版

```

GitHub 仓库

完整的代码、文档和示例都在 GitHub 上:

```

https://github.com/Tencent-Hunyuan/AuK

```

对谁有用?

  • 开发者:需要语音能力的 App/游戏/Web 开发者,可以基于 AuK 快速构建语音生成、剪辑、转写等功能
  • 内容创作者:视频博主、播客主播可以用它做语音克隆(替换台词)、音频增强、去噪等
  • 研究机构:MIT 协议让学术使用毫无顾虑,可作为基座模型做进一步研究
  • AI Agent 开发者:语音交互是 Agent 的关键一环,AuK 提供了从合成到编辑的完整工具链

总结

AuK 的开源是国产语音 AI 的一个重要节点。它用单一架构统一了语音生成与编辑的多项任务,配合 MIT 协议的开放性,为开发者和研究者提供了一个真正的"瑞士军刀"。无论你是在做语音助手、内容创作工具,还是前沿的语音研究,AuK 都值得加入你的技术栈。

---

来源:GitHub 仓库 [Tencent-Hunyuan/AuK](https://github.com/Tencent-Hunyuan/AuK)、[Hugging Face /tencent/AuK](https://huggingface.co/tencent/AuK)、ComfyUI Wiki、OrcaRouter AI 等多家媒体转述整理。

评论

0 条已公开
登录注册后可以参与评论。

正在加载评论...