Google发布Gemini 3.8 Live:支持97+语言的实时语音AI,可边说话边思考
基于多家媒体转述整理
Google于9月15日正式发布Gemini 3.8 Live和Gemini 3.8 Live Extended Thinking,这是谷歌在语音AI领域的一次重要升级。两个模型都通过Gemini API和Google AI Studio向开发者和企业开放,标志着语音交互从"问答式"向"实时协作式"转变。
能做什么
Gemini 3.8 Live最核心的突破是异步函数调用——模型可以在后台执行任务、调用API的同时,继续与用户进行自然对话。这意味着你不用等到所有操作完成才能听到回应,语音助手可以边干活边跟你聊天。
两个版本定位不同:标准版Gemini 3.8 Live专注于可扩展性和成本效率,适合日常语音交互场景;Extended Thinking版则面向复杂任务,支持多步骤推理,可以在思考的同时输出语音。
语言覆盖
新版本支持97种以上语言的实时识别与切换,用户在对话中可以自由切换语言,模型会自动检测并适配。同时支持视觉理解,可以在对话中实时处理图像输入。
性能表现
根据Artificial Analysis的数据,Gemini 3.8 Live Extended Thinking在语音到语音质量指数上排名第一(82.6分),在τ-Voice银行为任务完成率达到68.6%,Big Bench Audio测试得分97.7%。Google官方称其比上一代在上下文记忆上提升了15%,在复杂CRM任务中错误率降低11%。
为什么重要
这次发布的关键意义在于语音AI正在从"听-想-说"的线性模式,进化为"边听边想边说"的并行模式。异步函数调用让语音助手不再需要 pauses 来等待后台任务完成,用户体验更接近真实对话。这对客服机器人、车载语音助手、智能家居等场景都有直接价值。
谁在用
Google表示已内置于Gemini应用、Google Workspace和Search中。开发者可通过API接入,企业可使用Gemini Enterprise Agent Platform部署。