Bingdada Tech BlogBingdada Tech Blog
HomeBlogSEOGEOAEOAIToolsAbout
Log inSign up
Logo

Bingdada Tech Blog

A technical blog focused on SEO, GEO, and future AI trends.

Quick Links

  • Home
  • Blog Posts
  • About Us

Contact

  • 398848662@qq.com

Subscribe to our Newsletter for the latest SEO and GEO insights.

© 2024 Bingdada 技术博客. All rights reserved.

This article is in Simplified Chinese. Translate it to English with one click.
HomeBlogAI人工智能语音交互的临界点:Gemini 3.8 Live 双模型如何重新定义实时对话式 AI
语音交互的临界点:Gemini 3.8 Live 双模型如何重新定义实时对话式 AI
AI人工智能

语音交互的临界点:Gemini 3.8 Live 双模型如何重新定义实时对话式 AI

bingdadabingdada
September 22, 202660 reads6 min read
Quick Answer

Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款语音模型,核心突破是让推理与对话并行:前者主打规模化与成本效率,后者支持边思考边说话、多步后台任务处理。它们已接入 Gemini API、Google Workspace、Search 和 Gemini 应用。

Key Takeaways
  • Gemini 3.8 Live 面向规模化与成本效率,Extended Thinking 面向高复杂度任务,形成双轨产品策略。
  • Extended Thinking 在 Artificial Analysis 语音质量指数上以 82.6 分位列第一,τ-Voice 达 68.6%。
  • 模型支持 97 种语言并在对话中途自动切换,可处理近实时视觉输入。
  • 工具调用与 API 请求在后台执行时,对话不会中断,实现任务与聊天并行。
  • 国内豆包、通义千问、讯飞星火等也在语音方向投入,但代理式语音交互的公开数据相对有限。
Contents

Contents

  • 从「能说话」到「会思考着说话」
  • 两款模型的分工逻辑
  • 性能数据说明了什么
  • 真正值得关注的三项能力
  • 落地场景:从 Workspace 到 Search
  • 国内视角:语音 AI 的路线差异
  • 语音 AI 的下一站
  • 常见问题
  • Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 有什么区别?
  • 这两款模型支持哪些语言?
  • 开发者如何接入这些模型?
  • 评测数据是否代表真实使用效果?
  • 国内有类似的语音 AI 产品吗?
  • 关于 Bingdada

从「能说话」到「会思考着说话」

语音助手诞生多年,但真正让用户感到「像在和人对话」的产品并不多。大多数语音 AI 的瓶颈不在于识别准确率,而在于对话的连续性——一旦任务变复杂、需要调用工具或进行多步推理,对话就会中断、卡顿,甚至要求用户重新开始。

Google DeepMind 近期推出的 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款模型,正是针对这一痛点的系统性回应。它们的核心思路并非单纯提升语音识别或合成质量,而是让「推理」与「对话」在时间轴上并行发生。

两款模型的分工逻辑

这次发布采用了明确的双轨策略,而非用单一模型覆盖所有场景:

Gemini 3.8 Live 面向规模化与成本效率。它把对话智能、流畅交互和视觉理解整合在一起,适合需要大量并发、对延迟敏感的语音代理场景。

Gemini 3.8 Live Extended Thinking 则面向高复杂度任务。它允许模型在「说话」的同时进行多步推理,用「让我查一下……」这类早期语言线索自然地确认请求,并通过实时进度叙述引导用户完成多步骤后台任务。

这种分工意味着开发者不必在「快」和「聪明」之间二选一,而是可以根据业务场景选择合适的模型。

性能数据说明了什么

从公开的评测结果看,Extended Thinking 版本在多个维度上表现突出:在 Artificial Analysis 的 Speech to Speech Quality Index 上以 82.6 分位列第一;在 τ-Voice 基准上达到 68.6%,在 Sierra 的 τ-Voice-banking 基准上为 35.1%,这两项主要衡量代理式任务完成能力;在 Big Bench Audio 上则取得 97.7% 的推理成绩。

Gemini 3.8 Live 在 Speech Agent Arena 中排名第二,用户偏好度较高,同时保持了较强的成本优势。在 ServiceNow 的 EVA-Bench 评测中,两款模型在准确率与对话质量之间取得了较好的平衡。

需要说明的是,这些数据来自厂商公布的评测环境,实际表现会因部署方式、网络条件和任务类型而异。

真正值得关注的三项能力

抛开跑分,这次更新中最具实用价值的能力集中在三个方面:

视觉上下文的近实时处理。 Gemini 3.8 Live 能够处理视觉输入,让对话不再局限于纯语音。例如在员工入职引导场景中,模型可以结合画面内容回答即时问题;在演示中,它甚至能通过视觉信息实时对弈国际象棋。

对话中途的语言切换。 模型支持 97 种语言,并能在对话过程中自动检测和切换,这对跨国团队和 multilingual 客服场景意义明显。

后台任务与对话并行。 工具调用和 API 请求在后台执行时,模型仍能确认请求并继续聊天。Extended Thinking 版本更进一步,可以协调多步骤预订和异步函数调用,而不打断自然对话。

落地场景:从 Workspace 到 Search

这些能力已经进入具体产品。在 Google Workspace 中,Docs Live、Gmail Live 和 Keep Live 可以调用 Extended Thinking 版本;Search Live 提供基于 Gemini 3.8 Live 的实时排障帮助;Gemini 应用则支持 Daily Brief、语音处理收件箱和任务交接等功能。

对开发者而言,这些模型可通过 Gemini API 接入,为构建生产级语音代理提供了基础组件。

国内视角:语音 AI 的路线差异

把视线拉回国内,语音交互同样是各家大模型厂商的重点方向,但路线选择存在差异。

字节跳动的豆包在语音对话的流畅度和情感表达上投入较多,强调拟人化的交互体验;阿里巴巴的通义千问依托阿里云生态,在企业级语音客服和智能外呼场景中积累了大量落地案例;科大讯飞的星火模型则延续其在语音识别与合成领域的技术积累,在方言支持和嘈杂环境下的识别稳定性上有自身优势。DeepSeek 以开源和推理能力见长,但在实时语音交互的产品化程度上相对克制。

一个值得注意的差异是:Google DeepMind 这次把「边推理边说话」作为核心卖点,试图解决复杂任务中的对话中断问题;而国内多数产品目前仍以「快速响应、准确识别」为主要优化目标,在长链条任务与语音的并行处理上,公开的技术细节和评测数据相对有限。这既是差距,也意味着国内厂商在代理式语音交互方向仍有明确的追赶空间。

语音 AI 的下一站

Gemini 3.8 Live 系列传递出的信号很清晰:语音交互的竞争重心,正在从「识别得准不准」转向「能不能在对话中完成复杂任务」。当模型学会在说话的同时思考、在后台执行任务的同时保持对话,语音才真正从输入方式变成协作界面。

对开发者和企业来说,现在需要思考的问题不再是「要不要做语音」,而是「哪些任务适合交给语音代理」。

常见问题

Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 有什么区别?

Gemini 3.8 Live 侧重规模化与成本效率,适合高并发、低延迟的语音对话场景;Extended Thinking 版本侧重高复杂度任务,支持边推理边说话和多步后台任务处理。

这两款模型支持哪些语言?

Gemini 3.8 Live 支持 97 种语言,并能在对话过程中自动检测和切换语言。

开发者如何接入这些模型?

可通过 Gemini API 接入,同时这些能力已集成到 Google Workspace、Search 和 Gemini 应用中。

评测数据是否代表真实使用效果?

文中引用的成绩来自 Artificial Analysis、τ-Voice、Big Bench Audio、EVA-Bench 等公开评测,实际表现会因部署环境、网络条件和任务类型而有所不同。

国内有类似的语音 AI 产品吗?

有。豆包、通义千问、讯飞星火等都在语音交互方向持续投入,但在「边推理边说话」的代理式语音能力上,公开的技术细节和评测数据相对有限。

关于 Bingdada

Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。

编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com

© 2026 Bingdada. 保留所有权利。

Contents

  • 从「能说话」到「会思考着说话」
  • 两款模型的分工逻辑
  • 性能数据说明了什么
  • 真正值得关注的三项能力
  • 落地场景:从 Workspace 到 Search
  • 国内视角:语音 AI 的路线差异
  • 语音 AI 的下一站
  • 常见问题
  • Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 有什么区别?
  • 这两款模型支持哪些语言?
  • 开发者如何接入这些模型?
  • 评测数据是否代表真实使用效果?
  • 国内有类似的语音 AI 产品吗?
  • 关于 Bingdada
FAQ
Premium Ad Space · Limited Time
Advertise with us

Put your brand in the reader feed

In-article ad slots: high-attention moments perfect for product launches and event recruitment.

Partnership

Tags

#语音 AI#Google DeepMind#Gemini 3.8 Live#实时对话模型#Extended Thinking
bingdada

bingdada

SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

Related Posts

数字人对话时代来临:Gemini 3.8 Live 如何让 AI 拥有实时视觉形象
AI人工智能

数字人对话时代来临:Gemini 3.8 Live 如何让 AI 拥有实时视觉形象

Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,将实时视频生成与语音对话模型原生耦合,让 AI 拥有带精确唇形同步和自然表情的视觉形象,支持 97 种语言无缝切换和异步工具调用。

Sep 257 min read
云端也能守隐私:Google DeepMind 为 AI 持久记忆找到新解法
AI人工智能

云端也能守隐私:Google DeepMind 为 AI 持久记忆找到新解法

Google DeepMind 为 Private AI Compute 引入服务端持久记忆,让云端 AI 跨设备记事的同时,密钥仍留在用户设备上。本文拆解其安全隔离、端到端加密与可验证透明机制,并对比国内大模型厂商的隐私计算路线。

Sep 248 min read
当百万AI智能体开始互相交易:Google DeepMind为何押注千万美元研究多智能体安全
AI人工智能

当百万AI智能体开始互相交易:Google DeepMind为何押注千万美元研究多智能体安全

Google DeepMind 联合多家机构发起最高 1000 万美元的多智能体安全研究资助,聚焦百万智能体交互时的涌现风险。本文解析其四个优先方向,并对比国内智能体生态的进展与差异。

Sep 238 min read

Subscribe to our Newsletter

Get the latest SEO & GEO insights.

We respect your privacy. You can unsubscribe at any time.

Comments ({count}) (0)

Sign in to join the discussion

Sign inSign up
No comments yet, be the first to comment