
Gemini 3.8 Flash 是 Google 六周内发布的第三代 Flash 模型,在编程和多模态基准测试中大幅提升,逼近 Claude Opus 5。但其性能提升部分依赖推理时的强制超频,导致 Token 消耗增加,实际体验中深度思考能力仍显不足。
在人工智能模型竞赛进入白热化的阶段,Google 更新 Gemini 系列的速度令人咋舌。短短六周内,Flash 系列已经迎来了第三代产品——Gemini 3.8 Flash。这种高频迭代策略在业界并不多见,它反映出 Google 试图在轻量级模型上实现旗舰级 Agent 能力的迫切愿望。
单纯从命名来看,3.8 版本似乎只是 3.7 的常规升级。但仔细审视 Google 赋予这款模型的任务,会发现事情并不简单。官方定位中,Gemini 3.8 Flash 需要承担起编写和修改大型项目、反复调用外部工具、独立完成持续数小时的复杂工作流。这些在过去通常属于顶级 Agentic 模型的考核范畴。
Flash 系列最初的设计哲学是「更快、更便宜」,适合高频次、低延迟的调用场景。然而,随着 3.5 Pro 的迟迟未露面,Flash 系列被迫承担起更多「证明自己」的责任。这种错位让 3.8 Flash 的定位变得有些模糊:它既要保持速度优势,又要在深度推理上追赶旗舰模型。
从官方公布的基准测试结果来看,Gemini 3.8 Flash 的表现堪称惊艳。在衡量长程软件工程能力的 DeepSWE v1.1 测试中,它拿下了 71.0% 的成绩,较 3.7 Flash 的 65.3% 有显著提升,距离 Anthropic 的 Claude Opus 5 仅差 3 个百分点。而在一个半月前,3.6 Flash 在该项测试中仅有 49% 的得分。
除了编程,3.8 Flash 在多个维度都展现出旗舰级实力。在 HLE-Verified 测试中得分 54.9%,甚至略微超过了 Opus 5 的 54.4%。多模态方面同样不容小觑,复杂图表理解测试 CharXiv Reasoning 得分 86.2%,领先 Opus 5 的 83.7%;在 Agent 模式处理长视频的 LVBench 测试中,87.8% 的成绩更是超过了 GPT-5.6 Sol 等顶级模型。
金融和法律领域的专业测试同样传来捷报。在 Vals Finance Agent V2 和 Harvey's Legal Agent Benchmark 中,3.8 Flash 均展现出优于前代及部分昂贵前沿模型的性能。Google 还特别强调了其网络安全版本 3.8 Flash Cyber,在覆盖 20 种编程语言的内部漏洞发现测试中成功率超过 70%。
然而,跑分数据的光鲜并不能完全掩盖实际体验中的问题。社区反馈与独立测试往往得出与官方宣传不同的结论。有观点认为,3.8 Flash 所谓的「变强」,很大程度上源于推理过程中的「强制超频」——模型会执行更多推理步骤、更频繁地检查自己的工作,这直接导致 Token 消耗量显著增加。Google 甚至在官方文档中建议,如果任务更看重计算效率,用户可以选择降低推理档位或继续使用 3.7 Flash。这不禁让人质疑:这种通过增加算力消耗换来的性能提升,究竟有多大实际意义?
价格方面,3.8 Flash 与 3.7 Flash 保持一致:每百万 Token 输入 0.75 美元,输出 3.75 美元。但需注意,这只是限时优惠价格,2027 年 1 月 1 日起将恢复至输入 1.5 美元、输出 7.5 美元。
有趣的是,早在 3.6 Flash 发布时,Google 就曾表示优惠价仅持续到年底。如今 3.8 Flash 已发布,优惠期却依然延续。这种「更新模型速度远快于更新价格」的现象,从侧面反映出 Google 正通过价格优势吸引开发者生态,为后续的模型迭代铺路。
为了验证官方宣传的真实性,有开发者对 3.8 Flash 进行了独立测试。一项测试要求模型利用 Three.js 搭建空客 H145 直升机的 3D 模型。3.8 Flash 在不到一分钟内完成了需求拆解,随后以极快的速度输出代码,并在 109 秒内完成了场景与模型的搭建。从执行效率来看,Flash 系列的速度优势确实得到了保留。
但速度并不等于智能。另一位测试者指出,在需要深层逻辑推理和长程规划的任务中,3.8 Flash 的表现并未与 3.7 Flash 拉开决定性差距。它更像是一个高效的执行者,而非真正的思考者——对于需要创造性解决方案或跨领域知识融合的复杂问题,它仍然会暴露出「没开窍」的一面。
Google 在 Agent 能力上的激进布局,与国内大模型厂商的路线形成有趣对照。百度文心一言、阿里通义千问、DeepSeek 等团队同样在探索 Agent 方向,但策略更偏向于「场景驱动」——先解决具体行业痛点,再逐步扩展通用能力。
例如,DeepSeek 在代码生成与数学推理上的专注,使其在特定垂直领域展现出不错的竞争力;智谱 GLM 则通过与办公软件的深度整合,探索 Agent 在生产力工具中的落地场景。相比之下,Google 更倾向于通过模型本身的推理能力提升来驱动 Agent 进化,这种「模型中心论」与国内「场景中心论」的差异,将在未来一年内接受市场的检验。
Gemini 3.8 Flash 的发布延续了 Google 在模型迭代上的激进节奏。从基准测试看,它确实在多个维度逼近甚至超越了旗舰模型;从实际体验看,它依然是一个高效的工具,但距离真正的「自主 Agent」还有明显距离。
对于开发者和企业用户而言,3.8 Flash 的性价比优势不容忽视——在优惠期内,它可能是构建 Agent 应用最具吸引力的选择之一。但需要清醒认识到,跑分数字并不等同于实际业务价值,在选择模型时仍需基于具体场景进行评估。
主要提升体现在长程软件工程、复杂图表理解和多模态视频处理等任务上。在 DeepSWE v1.1 测试中,得分从 65.3% 提升至 71.0%;在 CharXiv Reasoning 测试中得分 86.2%,超过前代。这些提升部分源于模型在推理过程中会执行更多步骤和更频繁的自我检查。
目前限时优惠价格为每百万 Token 输入 0.75 美元、输出 3.75 美元。2027 年 1 月 1 日起,价格将分别恢复至 1.5 美元和 7.5 美元。
它在工具调用和长程任务执行上表现出色,适合构建需要高频交互的 Agent 应用。但需注意,更强的推理能力伴随更高的 Token 消耗,对于成本敏感型任务,建议根据实际情况调整推理档位或考虑 3.7 Flash。
这是 Google 针对网络安全场景推出的专用版本,用于漏洞发现和修复。在一项覆盖 20 种编程语言的内部测试中,成功率超过 70%。该模型仅通过 Fairwind Program 提供给可信的网络安全机构,不对普通用户开放。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
Put your brand in the reader feed
In-article ad slots: high-attention moments perfect for product launches and event recruitment.
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

DeepMind 的 Agent 实验揭示了一个尴尬现实:当数学难题变成跑分工具,AI 大厂竞相宣布「攻克名题」的背后,数学本身得到了什么?

从1992年的PowerBook Duo到2026年的折叠屏iPhone Duo,科技行业对「Duo」的偏爱背后,是一条关于便携设备如何按需扩展的三十四年设计脉络。本文梳理三代Duo产品的形态逻辑,并对比微软、谷歌及国内厂商的折叠屏探索。

苹果新CEO John Ternus首场发布会深度解读:折叠屏iPhone Duo为何等了近十年才入场?可变光圈和Apple Pencil的加入背后,折射出怎样的产品哲学转向?
Get the latest SEO & GEO insights.
We respect your privacy. You can unsubscribe at any time.