各厂语言模型

Google 给实时对话模型加上"真脸":Gemini Live Avatar 上线,能看能说还能边聊边查

2026年9月25日1 次阅读
Google 给实时对话模型加上"真脸":Gemini Live Avatar 上线,能看能说还能边聊边查

9月24日,Google 宣布推出 Gemini 3.8 Live with Live Avatar,并已在 Gemini Enterprise 正式可用(GA)。简单说,就是给 Gemini 的实时对话模型加上了一张"会动的脸":AI 在说话的同时,同步生成一段近实时的视频形象,口型对得上、表情自然、还能流畅地接话和换话轮。

这是什么

Google 在 9 月 15 日发布了 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两个实时对话模型,主打可规模化的低成本语音对话和高复杂度推理。这次的 Live Avatar 是在它之上新增的一层"视觉存在":模型同时处理音频和视频输入,然后以近实时的方式输出带表情的语音加视频回答。

按 Google 官方博客的说法,这套形象具备精确的口型同步、自然的面部表情和流畅的对话节奏切换——就像视频通话里的真人,而不是一张静止的头像。

几个值得注意的能力

  • 边聊边查工具:支持异步工具调用。AI 可以在后台发起工具调用、取数据,对话完全不被打断。Google 的演示里,化身一边和客人聊天,一边在后台完成酒店入住办理。
  • 能看懂画面:除了语音,它还能对摄像头画面和屏幕共享做实时视觉理解,支持在对话中打断插入。
  • 97 种语言不跑偏:Google 称对话切换到 97 种语言中的任何一种,化身的口型和表情都能保持一致,避免视频画面漂移。

怎么用、谁能用

目前该功能在 Gemini Enterprise 正式可用,企业客户可以在 Gemini Enterprise 控制台里试用,通过 Gemini Live API 文档接入。服务端点覆盖美国和欧盟,配套预置吞吐(provisioned throughput)、企业合规和数据治理。想要自定义专属头像的企业,需要联系 Google 销售走白名单流程。

需要注意的是,定位更高复杂度推理的 Gemini 3.8 Live Extended Thinking 仍处于私有预览阶段,还没全面开放。

为什么重要

对普通用户来说,这是"AI 助手有了脸"的一步;对企业来说,可能更实际——客服、产品导览、员工培训这类场景,第一次可以部署一个能听、能看、能说、还有表情的 AI 形象,而不只是语音机器人。异步工具调用 + 实时视觉理解的组合,也说明实时多模态对话正在从演示走向企业级可用。

本文基于 Google 官方博客、Google Cloud 官方博客,以及 The Verge、Unite.AI 等多家媒体转述整理。

来源:

  • https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-with-live-avatar/
  • https://cloud.google.com/blog/products/ai-machine-learning/gemini-3-8-live-with-live-avatar-is-now-generally-available
  • https://www.theverge.com/tech/1000328/google-gemini-ai-live-avatar-face
  • https://www.unite.ai/google-brings-live-avatar-visual-presence-to-gemini-3-8-live/

参考来源

评论

0 条已公开
登录或注册后可以参与评论。

正在加载评论...