
Google DeepMind 推出 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 两款语音模型,前者面向深度创意控制,可从零生成音色并逐行导演表演;后者面向高并发低成本场景。声音库从 30 种扩展至 2000+,支持 30 秒样本复刻,并配套 SynthID 水印与 C2PA 凭证保障安全。
过去几年,文本转语音(TTS)技术的竞争焦点一直停留在「像不像人」这个层面。但当拟真度逐渐逼近天花板,真正的差异化开始转向另一个维度:创作者能否像导演一样,精确指挥每一个声音的表情、节奏与情绪。Google DeepMind 团队近期在 Gemini 音频家族中推出的新一代语音模型,正是沿着这条思路迈出的关键一步。
根据 Google DeepMind 官方发布的信息,此次亮相的 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 被定位为「迄今最具表现力的音频生成模型」。它们不再满足于提供几十种固定音色供人挑选,而是把声音本身变成一种可被自然语言描述、逐行调度的创作素材。
理解这次更新,关键在于区分两个模型的定位差异。
Gemini 3.8 Flash TTS 面向的是需要精细打磨的创意场景——游戏角色配音、沉浸式有声书、播客以及互动媒体。它的核心能力是从零创造全新声音:用户只需用自然语言描述角色设定、口音和声音特征,就能跨越 100 多种语言与方言生成专属音色。
官方演示中出现了几个颇具代表性的例子:一个来自墨尔本、能量十足的 DJ 嗓音;一个极度单薄、毫无起伏的机器人声线;以及一条被赋予生命的日式巨龙。这些案例说明,模型处理的不只是「音色」,还包括角色性格与地域文化气质。
另一条线则务实得多。Gemini 3.8 Flash-Lite TTS 瞄准大批量配音、音频内容流水线生产以及高并发的语音智能体场景。它在音调、语速和表现细节上保留了细粒度控制,但更强调单位成本与吞吐效率。对于需要每天生成成千上万条音频的企业来说,这才是真正能落地的选项。
这次更新最具冲击力的数字,是声音库的扩张路径。
值得注意的是,声音复刻功能背后配套了同意验证机制、SynthID 水印以及 C2PA 内容凭证。这三重防护针对的正是当下最敏感的议题:当任何人都能复制他人声音时,如何证明「这段音频是谁授权的」。
此外,官方还预告了即将上线的声音混音功能:从声音库中挑一个基础音色,再用提示词微调音质、音高、语速和口音——比如「加入一点美国南方口音」或「让表达更柔和」。
如果说声音库解决的是「用谁的声音」,那么逐行控制解决的就是「怎么演」。
两个模型都支持在脚本中直接写入舞台指示,让 Gemini 根据自然语言线索调整每一句的演绎方式——从冷静的客服代表,到窃窃私语的悬疑场景。具体能力包括:
长篇生成稳定性:在数小时的连续音频中维持音质、节奏和角色音色的一致性,将说话人漂移降到最低,这对有声书和长播客至关重要。
原生双人场景调度:从单一脚本直接驱动多轮对话,两个声音既能清晰分离,又能实现自然的轮流接话,适合播客对谈或戏剧化叙事。
脚本化语气词与反馈音:通过 <laughs>、<sigh>、<gasp> 等非语言提示,以及 |mhm|、|yeah| 这类积极倾听的插话,为喜剧节奏和反应点提供精确控制。
这些能力的组合,实际上把 TTS 从「朗读工具」推向了「表演调度台」。
在语音生成这条赛道上,国内厂商的推进节奏同样密集,但侧重点存在差异。
字节跳动的豆包系列在语音克隆与情感合成上迭代迅速,强调低门槛的短视频与直播配音场景;科大讯飞的星火语音在方言覆盖和长文本稳定性上积累深厚,教育、政务等垂直行业渗透率较高;阿里通义千问的音频能力则更多与云服务和企业级 API 绑定,走的是平台化路线。
一个明显的分野在于安全与合规的技术路径。海外厂商倾向于用 SynthID 这类不可见水印加 C2PA 凭证构建跨平台溯源体系;国内则更多依托实名认证、声音授权协议与平台侧内容审核来约束滥用。两种思路各有取舍:前者便于跨生态验证,后者在落地执行上更直接。对于需要出海或跨国协作的团队来说,理解这套差异,往往比单纯比较音质指标更有实际价值。
把这次更新放回更大的技术脉络里看,它延续了 Gemini 音频家族此前的积累——3.5 Live Translate、3.5 Transcribe、3.8 Live 以及 3.8 Live Extended Thinking 已经铺好了实时翻译、转写与低延迟交互的基础。新一代 TTS 补上的,是「表达力」这块拼图。
对创作者而言,这意味着过去需要专业配音演员、录音棚和大量后期才能完成的工作,正在被压缩成一段提示词加一份脚本。但工具越强大,判断力就越稀缺——知道该让角色在哪一句停顿、在哪一个词上加重语气,这种审美决策仍然属于人。
Flash TTS 侧重深度创意控制,支持从零生成全新音色、逐行导演和长篇一致性,适合游戏、有声书和播客;Flash-Lite TTS 侧重高并发与成本效率,适合大批量配音和语音智能体,两者在表现力与吞吐量之间形成互补。
官方给出的门槛是 30 秒音频样本,即可重建一致的声线轮廓,但前提是必须拥有该声音的使用授权,并需通过内置的同意验证流程。
系统采用三重防护:同意验证机制确认声音授权、SynthID 嵌入不可见水印、C2PA 内容凭证记录来源信息,三者共同构成溯源与防伪链条。
生成式声音设计覆盖 100 多种语言与方言,即用型声音库提供 2000 种以上音色,并包含墨西哥西班牙语、魁北克法语、苏格兰英语等区域变体。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
Put your brand in the reader feed
In-article ad slots: high-attention moments perfect for product launches and event recruitment.
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,将实时视频生成与语音对话模型原生耦合,让 AI 拥有带精确唇形同步和自然表情的视觉形象,支持 97 种语言无缝切换和异步工具调用。

Google DeepMind 为 Private AI Compute 引入服务端持久记忆,让云端 AI 跨设备记事的同时,密钥仍留在用户设备上。本文拆解其安全隔离、端到端加密与可验证透明机制,并对比国内大模型厂商的隐私计算路线。

Google DeepMind 联合多家机构发起最高 1000 万美元的多智能体安全研究资助,聚焦百万智能体交互时的涌现风险。本文解析其四个优先方向,并对比国内智能体生态的进展与差异。
Get the latest SEO & GEO insights.
We respect your privacy. You can unsubscribe at any time.