
Gemini 3.8 Live with Live Avatar 是 Google DeepMind 推出的企业级功能,将实时视频生成与语音对话模型原生结合,使 AI 能以带精确唇形同步和自然表情的虚拟形象进行多语言对话,并支持后台异步工具调用而不中断对话流。
当我们谈论对话式 AI 时,通常想到的是文字或语音交互。但人类交流从来不只是声音的传递——表情、眼神、口型,这些视觉线索构成了沟通的重要维度。Google DeepMind 团队显然意识到了这一点。在 Gemini 3.8 Live 发布仅一周后,他们迅速推出了 Gemini 3.8 Live with Live Avatar,将实时视频生成能力与语音对话模型原生耦合,让 AI 拥有了可交互的视觉形象。
这不仅仅是给语音助手加一张脸。Live Avatar 的核心突破在于:它能够同时处理视觉和音频输入,在近乎实时的延迟下生成带有精确唇形同步、自然表情和流畅轮流对话的视频输出。对于企业级应用而言,这意味着虚拟客服、互动导览等场景可以从「听得到」升级为「看得见」。
Live Avatar 真正有技术含量的地方,在于它背后由 Gemini 的推理能力支撑的异步工具调用机制。
设想一个酒店前台场景:客人正在与虚拟形象对话办理入住,系统需要查询房间状态、验证身份信息、生成房卡。传统方案中,这些操作会导致对话卡顿或中断。而 Live Avatar 的做法是——在后台触发工具调用并获取数据的同时,前台对话继续进行,用户感知不到任何停顿。
这种「连续在场感」是体验层面的关键差异。它让 AI 虚拟形象从「一问一答的机器」变成了「能够处理复杂任务的服务者」。
Live Avatar 支持原生多语言语音到语音同步,能够在对话过程中无缝切换 97 种语言,且不会出现视频质量下降或视觉漂移。
这个数字值得细看。97 种语言的覆盖意味着它几乎可以服务全球主要市场的用户。更关键的是「无缝切换」——不是重新加载语言包,而是在对话中动态调整唇形和表情。比如一位用户用英语开始对话,中途切换为日语,虚拟形象的口型和表情会实时适配,不会出现「说日语但口型对不上」的尴尬。
对于跨国企业而言,这大幅降低了多语言虚拟服务的部署成本。一套系统、一个形象,就能覆盖全球用户。
企业在部署虚拟形象时,往往需要与品牌视觉识别保持一致。Live Avatar 提供了两条路径:一是使用预置的多样化虚拟形象库,二是通过高质量参考图像自定义生成。开发者可以从一张参考图出发,生成保留原始特征、品牌风格或角色身份的完整动画形象。
不过,自定义功能目前仅通过企业白名单开放。这种谨慎的开放策略,与 Google DeepMind 在安全层面的整体思路一致。
所有由 Live Avatar 生成的音视频输出都嵌入了 SynthID 水印。这是一种人眼不可感知的数字水印,直接编织在音频和视频信号中,用于帮助检测 AI 生成内容,减少误传和错误归因的风险。在深度伪造技术日益泛滥的当下,这种「默认透明」的设计思路值得关注。
在海外 Google DeepMind 推进 Live Avatar 的同时,国内厂商在数字人方向也有不少动作。百度文心一言体系下的数字人产品侧重于电商直播和内容播报场景,强调规模化复制和成本控制;阿里通义千问则在客服和政务场景中探索虚拟形象的应用,与自身云服务体系深度绑定。
差异在于技术路径和场景侧重。Google DeepMind 选择将 Live Avatar 与 Gemini 的推理能力、工具调用能力原生整合,强调的是「对话式 AI 的视觉延伸」;而国内产品更多从具体业务场景出发,先解决「有没有」的问题,再逐步提升交互自然度。在唇形同步和多语言支持等底层能力上,国内头部产品已接近可用水平,但在实时工具调用与对话流的无缝结合方面,仍有追赶空间。
目前该功能已在 Gemini Enterprise 中开放。开发者可以通过 API 文档了解接入方式。以下是接入的基本流程:
更多技术细节可参考 Gemini 官方文档 和 Google DeepMind 博客。
它是 Google DeepMind 在 Gemini 3.8 Live 基础上推出的功能扩展,将实时视频生成与语音对话模型原生结合,使 AI 能够以带有精确唇形同步和自然表情的虚拟形象进行对话。
支持 97 种语言的原生语音到语音同步,可在对话中无缝切换语言,唇形和表情会动态适配,不会出现视频质量下降或视觉漂移。
开发者可以从高质量参考图像生成保留原始特征和品牌风格的动画形象,但目前自定义功能仅通过企业白名单开放,需要联系 Google 申请。
所有输出都嵌入了 SynthID 不可感知水印,直接编织在音频和视频信号中,用于帮助检测 AI 生成内容,减少误传风险。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

Google DeepMind 为 Private AI Compute 引入服务端持久记忆,让云端 AI 跨设备记事的同时,密钥仍留在用户设备上。本文拆解其安全隔离、端到端加密与可验证透明机制,并对比国内大模型厂商的隐私计算路线。

Google DeepMind 联合多家机构发起最高 1000 万美元的多智能体安全研究资助,聚焦百万智能体交互时的涌现风险。本文解析其四个优先方向,并对比国内智能体生态的进展与差异。

Google DeepMind 发布 Gemini 3.8 Live 与 Extended Thinking 双模型,让推理与对话并行发生,语音 AI 从识别工具转向协作界面。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。