Google发布Gemini 3.8 Live:实时语音AI模型,成本降低40%-60%,性能登顶行业榜首
发布时间: 2026年9月17日 | 分类: 大语言模型动态
声明: 本文基于多家媒体转述整理
一句话结论
2026年9月15日,Google正式发布Gemini 3.8 Live系列模型,这是实时语音AI领域的重要突破——不仅支持边看边聊的多模态对话,还能在后台执行任务而不打断对话,且价格仅为竞争对手的40%-60%,性能登顶Artificial Analysis Speech-to-Speech排行榜榜首。
这是什么?
Google此次发布的Gemini 3.8 Live系列包含两个版本:
- Gemini 3.8 Live:主打规模与成本效率,适合常规语音对话场景
- Gemini 3.8 Live Extended Thinking:专为高复杂度任务设计,支持多步推理和同时思考说话
核心创新在于:
- 支持97种语言的中途自动切换
- 实时视觉输入处理,边看屏幕边对话
- 后台任务并行执行,对话流畅不打断
- 原生实时处理能力,无需额外中间件
这两个模型通过Google的Live API提供服务,可与Gemini App、Google Workspace和Search深度集成。
为什么这很重要?
价格革命:大幅降低语音AI门槛
| 服务类型 | Gemini 3.8 Live | OpenAI GPT-Live-1 |
|---|---|---|
| 音频输入 | $0.005/分钟 | - |
| 音频输出 | $0.018/分钟 | - |
| 语音对话 | $1.38/小时 | $2.3-3.5/小时 |
| Extended Thinking | $3.50/小时 | $5.83/小时 |
相比OpenAI同类服务,Google定价降低40%-60%,不到旧版GPT-Realtime 2.1价格的七分之一($10.75/小时)。
性能登顶:行业认证
- Artificial Analysis Speech-to-Speech Quality Index: #1 (82.6分)
- τ-Voice benchmark: 68.6%任务完成率
- Big Bench Audio: 97.7%准确率
- ServiceNow EVA-Bench: 复杂工作流表现优异
这些数据表明,Gemini 3.8 Live不仅在价格上有优势,在性能上也达到了行业领先水平。
谁会受益?
企业用户
- 客户服务语音助手,支持多语言自动切换
- 后台任务并行处理,提升运营效率
- 企业级安全与数据隐私保障
- 显著降低AI语音服务成本
开发者
- Live API直接接入,兼容OpenAI格式
- 多种部署选项,灵活集成
- 迁移成本低,快速上手
- 支持与Google生态深度整合
个人用户
- 通过Gemini App体验流畅语音交互
- Google Workspace中语音辅助办公
- Search语音搜索能力增强
- 更低的使用成本,更频繁的互动
技术亮点详解
实时多模态对话
Gemini 3.8 Live能够同时处理语音和视觉输入,让用户在对话过程中可以随时展示屏幕内容或实物,模型会实时理解并回应。这对于远程协作、教育辅导、技术支持等场景尤为有用。
后台任务并行
传统语音助手在处理复杂任务时往往需要中断对话。Gemini 3.8 Live可以在继续对话的同时,在后台执行API调用、数据查询等任务,实现"边聊边做"的体验。
Extended Thinking能力
Extended Thinking版本专为需要深度推理的任务设计,能够在思考的同时保持语音输出,适合金融分析、法律咨询、技术诊断等专业场景。
成本优化策略
思考token按输出费率计费,而非单独计价,这意味着用户在获得更强推理能力的同时,无需承担额外的费用风险。
如何使用?
通过Google Live API即可接入,主要方式包括:
- API直接调用:开发者可通过REST API集成到应用中
- SDK支持:提供多种语言的SDK,简化开发流程
- Google生态集成:直接在Gemini App、Workspace中使用
- 兼容性:兼容OpenAI API格式,已有应用可快速迁移
对于企业用户,Google还提供了Enterprise Agent Platform,支持更复杂的工作流配置和权限管理。
行业影响与展望
Google此次发布直接将实时语音AI的价格门槛大幅降低,有望加速企业级语音助手普及。从市场竞争角度看:
- 价格竞争白热化:Google以明显低于竞争对手的定价,迫使行业重新审视定价策略
- 技术门槛降低:更低的价格意味着更多中小企业可以用得起先进的语音AI
- 应用场景扩展:从简单的客服问答扩展到复杂的企业工作流
与之前DeepSeek在文本模型的性价比竞争形成呼应——AI正在从"昂贵的前沿技术"向"普惠的基础设施"转变。未来,我们可能看到更多厂商跟进降价,最终受益的是整个生态系统和终端用户。
注意事项
- 版本选择:Extended Thinking版本价格略高,适合复杂推理任务;基础版适合常规对话
- 成本控制:思考token按输出费率计费,需注意长时间推理的成本累积
- 隐私考量:企业用户应关注数据隐私政策,确保符合合规要求
- 兼容性:虽然兼容OpenAI格式,但部分高级功能可能需要特定SDK支持
结语
Google Gemini 3.8 Live的发布,标志着实时语音AI进入了一个新的阶段——不再是少数企业的专属工具,而是更多人可以负担的日常助手。当价格下降、性能提升、易用性增强三者同时实现时,AI语音交互的普及将加速到来。
对于开发者而言,这是一个快速构建语音AI应用的好时机;对于企业而言,这是降本增效的新选择;对于普通用户而言,这是更智能、更亲近的数字助手时代的开始。
AI的民主化进程,正在以我们意想不到的速度推进。
本文基于多家媒体转述整理,来源包括:Google官方博客、NDTV Profit、Gekro、AI Disruption等(2026年9月15-16日报道)。