语音模型

Google 发布 Gemini 3.8 Live 系列语音模型:边聊边干活,还能看懂你指的东西

2026年9月16日1 次阅读
Google 发布 Gemini 3.8 Live 系列语音模型:边聊边干活,还能看懂你指的东西

这是什么

Google 在 9 月 15 日发布了两个新的实时语音对话模型:Gemini 3.8 LiveGemini 3.8 Live Extended Thinking。简单说,这是 Gemini 目前最先进的"边说边想"语音模型,你可以像打电话一样和 AI 对话,它几乎实时回应。

两个模型分工不同:

  • Gemini 3.8 Live:主打规模和性价比,对话流畅、反应快,适合大规模部署。它在 Speech Agent Arena 排行榜上拿了第二名,用户偏好度高。
  • Gemini 3.8 Live Extended Thinking:主打高复杂度任务,会"多想几步"再回答。它在 Artificial Analysis 的语音对语音质量指数(Speech to Speech Quality Index)拿下 82.6 分排名第一,在语音代理任务基准 τ-Voice 上完成率 68.6%,Big Bench Audio 推理测试得分 97.7%。

为什么重要

以前的语音助手有个老大难问题:你让它干活,它要么立刻回答但答不好,要么沉默半天在想。这次的新模型解决的就是"边聊边干活":

  • 后台执行工具调用:你可以让模型一边继续和你聊天,一边在后台调 API、跑任务。任务没完成也不耽误你问下一句。
  • 看得懂画面:3.8 Live 支持近实时的视觉输入,你在手机摄像头前指着什么东西问,它能结合画面回答。
  • 97 种语言随时切换:对话中途换语言,模型自动跟上,不用设置。

对普通用户来说,这些能力会直接体现在 Gemini App、Search Live(搜索的实时对话模式)、Google Workspace 等产品里。和过去把语音识别(ASR)和语音合成(TTS)拆成两步的流水线不同,这类模型直接"听音说话",延迟和自然度都更好。对开发者来说,两个模型从今天起在 Gemini API 和 Google AI Studio 可用;企业版目前在 Gemini Enterprise 处于私下预览阶段。

几个值得注意的点

  • 所有 AI 生成的音频都带 SynthID 水印——人耳听不出来,但机器能检测,用于防止伪造音频传播。
  • Extended Thinking 版本在定价上"与其他前沿模型相比有竞争力",但 Google 没有给出具体价格。
  • 企业级的客户体验版(Gemini Enterprise for Customer Experience)即将推出,做客服语音机器人的团队可以关注。

对谁有用

  • 开发者:想做语音代理(订票、客服、预约)的团队,现在可以在 Gemini API / AI Studio 里直接调这两个模型。
  • 普通用户:如果你在用 Gemini App 或 Google AI Pro/Ultra 订阅,接下来会在 Gemini Live、Docs、Gmail、Keep 里陆续体验到。
  • 企业:重度依赖语音客服的公司,可以等 Gemini Enterprise 正式开放后再评估。

*本文基于 Google 官方博客公告整理。*

参考来源

评论

0 条已公开
登录注册后可以参与评论。

正在加载评论...