Deepgram 发布 Flux TTS:首个对话原生语音合成模型,80ms 延迟+跨轮次上下文,盲测击败 ElevenLabs
做语音 Agent 的开发者都遇到过这个问题:TTS 模型单听一句话挺好,放到真实对话里就露馅——语气忽高忽低,被打断后不知道怎么接,报个账号号码还能念错。
Deepgram 今天发布的 Flux TTS 就是冲着这个问题来的。它不是又一个"声音好听"的 TTS,而是第一个对话原生(conversation-native)的语音合成模型:在合成每一句话之前,它会"读"整段对话的上下文,然后决定用什么语气、节奏和情感来说。
对话原生,到底有什么不同?
传统 TTS 的工作方式是:给一句文本,合成一段语音。每句话都是独立的,上一句的语气不会影响下一句。
Flux TTS 不一样。它把整个对话当作一个连续流来处理:
- 跨轮次一致性:前文是安慰的语气,后文不会突然变成播报腔。整段对话的语气、节奏、情感是连贯的。
- 不需要 SSML 或 style 标签:它自动根据对话内容调整表达方式,不用手动标注"这里要温柔""那里要强调"。
- 原生打断处理:用户中途插话时,模型能立即停止当前语音,并返回"已经说了什么、还没说什么",方便 Agent 调整后续回复。
简单说,传统 TTS 像一个只会念稿的播音员,Flux TTS 更像一个真正在跟你聊天的搭档。
关键性能:不只是"好听",还要"说对"
Deepgram 给出了一组比较硬的指标:
盲测排名第一:在 A/B 对比测试中,Flux TTS 胜率 73.4%,超过 Cartesia Sonic 3.5(72.0%)、Google Gemini 2.5 Flash(62.4%)、ElevenLabs Eleven v3(61.2%)等一众竞品。
结构化内容词错率仅 3.4%:药名、账号、金额、字母数字这类"硬词",Flux TTS 的错误率远低于 ElevenLabs v3(5.0%)和 Cartesia(6.6%)。对客服场景来说,把 "$2,847" 念成 "$2,837" 可能就是投诉。
首字延迟低至 80ms:在对话场景下,响应速度直接影响体验。80ms 意味着用户几乎感觉不到等待。
打断与实时交互:真实对话的试金石
语音 Agent 最怕的不是"说得不好听",而是"被打断后不知道怎么办"。
Flux TTS 的打断机制设计得很实用:
- 检测到用户插话(barge-in),立即中断当前语音
- 返回
text_spoken(已经播放的文本)和text_remaining(还没播放的文本) - Agent 可以根据用户的新输入,决定是继续说完、还是换一个回答
举个例子:Agent 正在说"您的余额是 $2,847——",用户打断问"这是付款前的吗?",Agent 能立刻接上"是的,这是今早的余额,需要我拉完整账单吗?"——而不是从头重念一遍。
部署与生态:一个 API 搞定听和说
Flux TTS 不是单独卖的。它和之前发布的 Flux STT(语音识别)跑在同一个连接上,通过 Deepgram 的 Voice Agent API 统一调度"听→想→说"的整个流程。
部署方式也很灵活:
- 云端:直接用 Deepgram 托管服务
- VPC / 本地部署:满足医疗、金融等行业的合规需求
- HIPAA + SOC 2:合规认证已包含
生态集成方面,已经支持 Vapi、Pipecat、LiveKit、Jambonz、Cloudflare 等主流语音 Agent 框架。从其他 TTS 迁移过来只需要改一下 model 参数(flux-{voice}-en)。
免费期:9 月 12 日之前可以免费使用,最多 45 个并发流(EU/AU 区域 5 个)。之后按标准定价收费。
对谁有用?
- 语音 Agent 开发者:客服、销售预约、订餐、技术支持——任何需要"真实对话"而非"念稿"的场景
- 有合规需求的企业:医疗、金融等行业需要本地部署和数据驻留
- 正在用 ElevenLabs / Cartesia 的团队:盲测数据 + 词错率数据值得认真对比一下
总结
Flux TTS 的核心信号是:语音 Agent 赛道正在从"谁的声音最好听"转向"谁的对话最靠谱"。能保持上下文一致性、能处理打断、能把账号号码念对——这些才是生产环境真正需要的。Deepgram 用 Flux STT + Flux TTS 的组合,把语音 Agent 的"听"和"说"统一到了一个 API 里,对开发者来说确实省了不少拼接的麻烦。