
Gemini 3.5 Transcribe 是 Google DeepMind 推出的新一代语音转文本模型,通过智能转录、自定义词汇表和函数调用等能力,实现了从简单语音识别到理解用户意图的跨越。其非流式词错误率低至 2.6%,并支持 85+ 种语言,为开发者和终端用户提供了更自然、更精准的语音交互体验。
在人工智能的演进版图中,语音交互正从“能听会说”迈向“听得懂、说得准”的新阶段。Google DeepMind 团队近期推出的 Gemini 3.5 Transcribe 模型,正是这一趋势下的关键落子。它不仅仅是一个升级版的语音识别工具,更是一个能够理解语境、清理口语瑕疵、甚至调用其他 AI 模型执行复杂任务的智能语音前端。
传统语音识别模型(ASR)的核心任务是将音频波形转换为文字序列,其评价标准往往聚焦于词错误率(WER)。然而,在真实场景中,背景噪音、专业术语、口音差异以及人类口语中固有的“嗯”、“啊”和自我纠正,都会让简单的“识别”变得力不从心。Gemini 3.5 Transcribe 的设计哲学,正是要打破这种局限。
根据 Google 官方发布的技术博客,该模型直接处理原始音频,并输出“准确、精炼、格式化”的文本。这意味着,它能够自动过滤掉口头禅(如“那个”、“就是”),正确处理“我们周二见——不,周三见”这类自我修正的表述,并自动添加标点符号。这种能力被官方称为“智能转录”(Smart Transcription),它让机器的输出更接近人类编辑后的文稿,而非生硬的语音转写记录。
从技术架构上看,Gemini 3.5 Transcribe 代表了 Google DeepMind 在端到端语音模型上的持续深耕。与上一代 Chirp 3 模型相比,其性能提升显著。据第三方评测机构 Artificial Analysis 的测量,Gemini 3.5 Transcribe 在流式(实时)场景下的平均词错误率(WER)为 4.0%,非流式(离线)场景下则降至 2.6%。更值得关注的是,其“最终转录时间”(time to final transcription)相比 Chirp 3 提升了 70%,这意味着用户等待完整结果的时间大幅缩短,交互体验更加流畅。
对于开发者而言,Gemini 3.5 Transcribe 提供了清晰且功能强大的接入方式。Google DeepMind 将其能力拆分为两个独立的 API,以满足不同场景的需求:
gemini-3.5-transcribe-live 模型,提供亚秒级延迟的双向流式传输。这适用于构建语音代理(Voice Agents)、实时字幕工具等对交互性要求极高的应用。gemini-3.5-transcribe 模型,处理已录制的音频、会议记录、通话日志等。该 API 支持说话人分离(目前最多支持 3 人,3 人以上为实验性功能)和词级时间戳,为后续的呼叫中心分析、会议纪要生成等后处理流程提供了数据基础。除了基础的转录能力,该模型还具备多项对开发者极具吸引力的特性:
Gemini 3.5 Transcribe 的野心不止于提供一个更精准的 API。Google DeepMind 正在将其深度整合进自家的产品生态,如 Gboard 输入法(Android 上的 Rambler 功能)、Gemini macOS 应用、Google Antigravity 开发平台以及未来的 Chrome 浏览器。
这种整合策略的核心在于“上下文感知”(Context-Awareness)。在 macOS 的 Gemini 应用中,3.5 Transcribe 可以结合屏幕上下文和聊天记录,实现精准的转录。例如,当用户说“把这段文字改成更正式的语调”时,模型不仅需要听清语音,还需要理解“这段文字”指代的是屏幕上哪个文档、哪段内容。这已经超越了传统语音识别的范畴,进入了“语音代理”(Voice Agent)的领域。
在 Google Antigravity 平台上,3.5 Transcribe 能够结合屏幕上下文,确保对文件名、代码逻辑等内容的转录准确。而在 Chrome 浏览器中,即将推出的“在任意网页字段中语音输入”功能,则预示着语音交互将成为浏览器的基础能力。
这种将语音能力嵌入操作系统级入口的做法,使得 Google DeepMind 在 AI 语音代理的竞争中占据了有利位置。它不再是一个孤立的工具,而是一个可以连接屏幕、文档、应用和生成式 AI 模型的枢纽。
Google DeepMind 在语音智能领域的快速迭代,也为国内 AI 厂商提供了参照。目前,国内的语音交互赛道呈现出“通用大模型 + 专用语音模型”双轮驱动的格局。
与 Gemini 3.5 Transcribe 的“智能转录 + 函数调用”路径相比,国内厂商在垂直场景深耕(如会议转写、同声传译、客服质检)上投入巨大,但在跨应用上下文理解和语音驱动复杂工作流方面,仍处于追赶状态。Gemini 3.5 Transcribe 所展示的“语音作为 Agent 入口”的理念,即通过语音调用其他 AI 模型完成任务,是国内厂商下一步需要重点突破的方向。
尽管 Gemini 3.5 Transcribe 表现亮眼,但它也面临着一些现实挑战。
首先,多说话人分离目前仍有限制(超过 3 人效果不稳定),在嘈杂的多人会议场景下,准确率仍有提升空间。其次,延迟与算力的权衡是永恒的话题。虽然流式延迟已降至亚秒级,但在复杂网络环境和低端设备上的表现尚未可知。最后,隐私与安全问题不容忽视。语音数据属于高度敏感的个人信息,如何在提供上下文感知的转录服务时,确保用户数据不被滥用,是 Google DeepMind 和所有 AI 厂商必须面对的课题。
展望未来,语音交互将不再是孤立的“识别”,而是成为连接用户意图与数字世界的“神经末梢”。Gemini 3.5 Transcribe 让我们看到了一个可能性:未来的计算机,将真正理解我们“说”出来的每一个指令,并自动完成背后的一系列复杂操作。Google DeepMind 的这一步,无疑将加速这一天的到来。
根据官方数据,Gemini 3.5 Transcribe 在多项关键指标上优于 Chirp 3。其非流式词错误率(WER)从 Chirp 3 的 6.4% 降至 2.6%,流式 WER 也显著下降。更重要的是,其“最终转录时间”提升了 70%,这意味着用户等待完整结果的时间大幅缩短,交互体验更加流畅。此外,它还新增了智能转录(清理口语瑕疵)、自定义词汇表等功能。
开发者可以通过两个 API 接入:一是用于实时交互的 Live API(使用 gemini-3.5-transcribe-live 模型),支持亚秒级延迟的双向流式传输;二是用于处理预录音频的 Interactions API(使用 gemini-3.5-transcribe 模型),支持说话人分离和词级时间戳。这两个 API 均可通过 Google AI Studio 和 Gemini Enterprise Agent Platform 访问。
该模型支持自动检测和转录超过 85 种语言,并能处理地区口音和方言。在说话人识别方面,预录音频处理 API 目前支持准确区分最多 3 个说话人,并附带时间戳;对于 3 个以上说话人的场景,官方标注为实验性功能。
“智能转录”是 Gemini 3.5 Transcribe 的核心特性之一。它不仅能将语音转为文字,还能自动处理口语中的不流畅现象。例如,它会自动过滤“嗯”、“啊”等填充词,正确理解“我们周二见——不,周三见”这类自我纠正的表述,并为文本添加正确的标点符号和格式,使转录结果更接近人工编辑后的文稿。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

Google 正把 AI 语言能力从文字翻译推进到原生音频理解,覆盖 300 多种语言,并通过社区合作补齐低资源语种数据。本文解析其技术路径、开放数据项目,并对比国内厂商的多语言进展。

Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,将实时视频生成与语音对话模型原生耦合,让 AI 拥有带精确唇形同步和自然表情的视觉形象,支持 97 种语言无缝切换和异步工具调用。

Google DeepMind 为 Private AI Compute 引入服务端持久记忆,让云端 AI 跨设备记事的同时,密钥仍留在用户设备上。本文拆解其安全隔离、端到端加密与可验证透明机制,并对比国内大模型厂商的隐私计算路线。
最新の SEO・GEO 情報をお届けします。
プライバシーを尊重します。いつでも購読を解除できます。