语音模型

IndexTTS-2.5 开源发布:多语言零样本语音克隆,支持情感与语速精细控制

2026年8月12日2 次阅读
IndexTTS-2.5 开源发布:多语言零样本语音克隆,支持情感与语速精细控制

8月10日,IndexTeam 正式发布 IndexTTS-2.5,这是其开源零样本文本转语音(TTS)系统的最新版本。只需一条参考音频,即可克隆说话人的声音,并支持中文、英文、日语、西班牙语和阿拉伯语五种语言。

相比 2.0 的核心升级

IndexTTS-2.5 在前代基础上带来了多项实用改进:

  • 多语言扩展:新增中文、西班牙语和阿拉伯语支持,覆盖全球使用人数最多的几种语言。
  • 情感与音色解耦:细粒度情感控制让克隆的声音可以表达不同情绪,同时保持音色稳定,不会因为情感变化而"变声"。
  • 语速控制:通过 duration_factor 参数,可在 0.5x 到 2.0x 之间调节语速,适配不同场景需求。
  • 发音控制:支持中文拼音、英文 CMU 音素和日文假名三种发音标注方式,对多音字、专有名词等场景更精准。
  • 推理加速:相比 IndexTTS-2 推理速度更快。
  • 生产部署:新增 vLLM 支持,可直接用于线上服务。

硬件门槛

根据社区实测,8GB 显存即可本地运行,ComfyUI 整合包已由社区开发者 T8star-Aix 制作发布,降低了部署门槛。

获取方式

  • 代码仓库:https://github.com/index-tts/index-tts
  • 模型权重:HuggingFace(IndexTeam/IndexTTS-2.5)和 ModelScope 均已上线
  • 技术论文:https://arxiv.org/abs/2601.03888

基于 GitHub 官方仓库及社区教程整理。

参考来源

评论

0 条已公开
登录注册后可以参与评论。

正在加载评论...