
Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款语音模型,核心突破是让推理与对话并行:前者主打规模化与成本效率,后者支持边思考边说话、多步后台任务处理。它们已接入 Gemini API、Google Workspace、Search 和 Gemini 应用。
语音助手诞生多年,但真正让用户感到「像在和人对话」的产品并不多。大多数语音 AI 的瓶颈不在于识别准确率,而在于对话的连续性——一旦任务变复杂、需要调用工具或进行多步推理,对话就会中断、卡顿,甚至要求用户重新开始。
Google DeepMind 近期推出的 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款模型,正是针对这一痛点的系统性回应。它们的核心思路并非单纯提升语音识别或合成质量,而是让「推理」与「对话」在时间轴上并行发生。
这次发布采用了明确的双轨策略,而非用单一模型覆盖所有场景:
Gemini 3.8 Live 面向规模化与成本效率。它把对话智能、流畅交互和视觉理解整合在一起,适合需要大量并发、对延迟敏感的语音代理场景。
Gemini 3.8 Live Extended Thinking 则面向高复杂度任务。它允许模型在「说话」的同时进行多步推理,用「让我查一下……」这类早期语言线索自然地确认请求,并通过实时进度叙述引导用户完成多步骤后台任务。
这种分工意味着开发者不必在「快」和「聪明」之间二选一,而是可以根据业务场景选择合适的模型。
从公开的评测结果看,Extended Thinking 版本在多个维度上表现突出:在 Artificial Analysis 的 Speech to Speech Quality Index 上以 82.6 分位列第一;在 τ-Voice 基准上达到 68.6%,在 Sierra 的 τ-Voice-banking 基准上为 35.1%,这两项主要衡量代理式任务完成能力;在 Big Bench Audio 上则取得 97.7% 的推理成绩。
Gemini 3.8 Live 在 Speech Agent Arena 中排名第二,用户偏好度较高,同时保持了较强的成本优势。在 ServiceNow 的 EVA-Bench 评测中,两款模型在准确率与对话质量之间取得了较好的平衡。
需要说明的是,这些数据来自厂商公布的评测环境,实际表现会因部署方式、网络条件和任务类型而异。
抛开跑分,这次更新中最具实用价值的能力集中在三个方面:
视觉上下文的近实时处理。 Gemini 3.8 Live 能够处理视觉输入,让对话不再局限于纯语音。例如在员工入职引导场景中,模型可以结合画面内容回答即时问题;在演示中,它甚至能通过视觉信息实时对弈国际象棋。
对话中途的语言切换。 模型支持 97 种语言,并能在对话过程中自动检测和切换,这对跨国团队和 multilingual 客服场景意义明显。
后台任务与对话并行。 工具调用和 API 请求在后台执行时,模型仍能确认请求并继续聊天。Extended Thinking 版本更进一步,可以协调多步骤预订和异步函数调用,而不打断自然对话。
这些能力已经进入具体产品。在 Google Workspace 中,Docs Live、Gmail Live 和 Keep Live 可以调用 Extended Thinking 版本;Search Live 提供基于 Gemini 3.8 Live 的实时排障帮助;Gemini 应用则支持 Daily Brief、语音处理收件箱和任务交接等功能。
对开发者而言,这些模型可通过 Gemini API 接入,为构建生产级语音代理提供了基础组件。
把视线拉回国内,语音交互同样是各家大模型厂商的重点方向,但路线选择存在差异。
字节跳动的豆包在语音对话的流畅度和情感表达上投入较多,强调拟人化的交互体验;阿里巴巴的通义千问依托阿里云生态,在企业级语音客服和智能外呼场景中积累了大量落地案例;科大讯飞的星火模型则延续其在语音识别与合成领域的技术积累,在方言支持和嘈杂环境下的识别稳定性上有自身优势。DeepSeek 以开源和推理能力见长,但在实时语音交互的产品化程度上相对克制。
一个值得注意的差异是:Google DeepMind 这次把「边推理边说话」作为核心卖点,试图解决复杂任务中的对话中断问题;而国内多数产品目前仍以「快速响应、准确识别」为主要优化目标,在长链条任务与语音的并行处理上,公开的技术细节和评测数据相对有限。这既是差距,也意味着国内厂商在代理式语音交互方向仍有明确的追赶空间。
Gemini 3.8 Live 系列传递出的信号很清晰:语音交互的竞争重心,正在从「识别得准不准」转向「能不能在对话中完成复杂任务」。当模型学会在说话的同时思考、在后台执行任务的同时保持对话,语音才真正从输入方式变成协作界面。
对开发者和企业来说,现在需要思考的问题不再是「要不要做语音」,而是「哪些任务适合交给语音代理」。
Gemini 3.8 Live 侧重规模化与成本效率,适合高并发、低延迟的语音对话场景;Extended Thinking 版本侧重高复杂度任务,支持边推理边说话和多步后台任务处理。
Gemini 3.8 Live 支持 97 种语言,并能在对话过程中自动检测和切换语言。
可通过 Gemini API 接入,同时这些能力已集成到 Google Workspace、Search 和 Gemini 应用中。
文中引用的成绩来自 Artificial Analysis、τ-Voice、Big Bench Audio、EVA-Bench 等公开评测,实际表现会因部署环境、网络条件和任务类型而有所不同。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
Поместите бренд в ленту читателя
Рекламные места внутри статей — моменты высокого внимания, идеальны для запуска продуктов и набора на мероприятия.
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,将实时视频生成与语音对话模型原生耦合,让 AI 拥有带精确唇形同步和自然表情的视觉形象,支持 97 种语言无缝切换和异步工具调用。

Google DeepMind 为 Private AI Compute 引入服务端持久记忆,让云端 AI 跨设备记事的同时,密钥仍留在用户设备上。本文拆解其安全隔离、端到端加密与可验证透明机制,并对比国内大模型厂商的隐私计算路线。

Google DeepMind 联合多家机构发起最高 1000 万美元的多智能体安全研究资助,聚焦百万智能体交互时的涌现风险。本文解析其四个优先方向,并对比国内智能体生态的进展与差异。
Получайте свежие материалы по SEO и GEO.
Мы уважаем вашу конфиденциальность. Отписаться можно в любой момент.
Войдите, чтобы присоединиться к обсуждению