Bingdada テックブログBingdada テックブログ
ホームブログSEOGEOAEOAIツール私たちについて
ログイン登録
Logo

Bingdada テックブログ

SEO、GEO、そして未来のAIトレンドに焦点を当てたテックブログ。

クイックリンク

  • ホーム
  • ブログ記事
  • 私たちについて

お問い合わせ

  • 398848662@qq.com

最新の SEO・GEO 情報をお届けするニュースレターを購読してください。

© 2024 Bingdada 技术博客. All rights reserved.

この記事は簡体字中国語です。日本語 にワンクリックで翻訳できます。
ホームブログAI人工智能Google DeepMind 发布 Gemini 3.8 Flash 双版本:从智能体编程到自动化漏洞修复的全面跃迁
Google DeepMind 发布 Gemini 3.8 Flash 双版本:从智能体编程到自动化漏洞修复的全面跃迁
AI人工智能

Google DeepMind 发布 Gemini 3.8 Flash 双版本:从智能体编程到自动化漏洞修复的全面跃迁

bingdadabingdada
9月 13, 202640 回の閲覧約 7 分で読めます
post.quickAnswer

Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber 两个变体,共享同一底层智能核心。前者面向长周期编程与自主智能体,定价与 3.7 Flash 相同;后者专攻网络安全防御,通过 Fairwind Program 向受信任防御方开放,在漏洞发现与自动补丁上达到前沿水平。

post.keyTakeaways
  • Gemini 3.8 Flash 延续 3.7 Flash 定价,每百万输入 token 0.75 美元、输出 3.75 美元,性能却大幅提升。
  • 3.8 Flash 通过更多推理步骤与迭代工具调用,在长周期软件工程与专业领域基准上逼近高成本前沿模型。
  • Gemini 3.8 Flash Cyber 在 CyberGym 与内部 20 语言基准上展现前沿级漏洞发现能力,内部成功率超 70%。
  • CWE-Bench 补丁基准上 pass@1 达 47.2%,与领先前沿模型 47.8% 几乎持平但成本更低。
  • Chrome 安全团队与 Wiz 的真实测试验证了 3.8 Flash Cyber 在补丁生成与渗透测试召回率上的优势。
目次

目次

  • 一次发布,两条战线:Google DeepMind 把 Flash 系列推向新高度
  • 为什么 3.8 Flash 能在编程任务上逼近高成本前沿模型?
  • 实际演示:从 3D 游戏到 DOS 版谷歌地图
  • Gemini 3.8 Flash Cyber:把防御能力做成前沿水平
  • 自主漏洞发现
  • 自动化补丁修复
  • 真实场景验证
  • 国内视角:国产大模型在智能体编程与安全方向的进展
  • 开发者该如何选择?
  • 常见问题
  • Gemini 3.8 Flash 和 3.8 Flash Cyber 有什么区别?
  • Gemini 3.8 Flash 的定价是多少?
  • 3.8 Flash 在编程基准上的表现如何?
  • 什么是 Fairwind Program?
  • 国内有哪些同类产品值得关注?
  • 关于 Bingdada

一次发布,两条战线:Google DeepMind 把 Flash 系列推向新高度

当业界还在消化三周前 Gemini 3.7 Flash 带来的冲击时,Google DeepMind 再次出手。六周内第三次更新 Flash 产品线,这次一口气推出两个变体——Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber。前者瞄准长周期编程与自主智能体,后者则专攻网络安全防御场景。两者共享同一套底层智能核心,却在各自领域展现出接近甚至超越更大规模前沿模型的能力。

从定价策略看,Gemini 3.8 Flash 延续了 3.7 Flash 的入门价格:每百万输入 token 0.75 美元,每百万输出 token 3.75 美元。这意味着性能提升并未伴随成本上涨,对于需要大规模部署智能体工作流的企业而言,这一信号尤为关键。

为什么 3.8 Flash 能在编程任务上逼近高成本前沿模型?

核心设计思路可以概括为一句话:让模型更“肯干”。在复杂任务中,Gemini 3.8 Flash 会主动执行更多推理步骤,反复调用工具进行迭代验证。这种“长周期智能体循环”机制,使其在 DeepSWE v1.1 长周期软件工程基准上,能够以远低于大型前沿模型的成本,端到端自主解决复杂工程问题。

在量化金融与专业法律领域,3.8 Flash 同样表现突出。Vals Finance Agent V2 与 Harvey 法律智能体基准测试中,它均超越了 3.7 Flash 及其他前沿模型。HLE-Verified 测试中达到 54.9% 的成绩,说明其在 STEM、人文学科与专业领域的多步推理能力已相当扎实。

值得注意的是,这种性能提升并非没有代价。模型在高努力级别下可能消耗更多 token。对于计算效率优先的场景,开发者可以选择降低努力级别,或继续使用仍获全面支持的 Gemini 3.7 Flash。

实际演示:从 3D 游戏到 DOS 版谷歌地图

Google DeepMind 展示了一系列由 Gemini 3.8 Flash 在 Google Antigravity 与 Google AI Studio 中构建的案例:

  • 仅用一条循环指令提示词,便生成了一款包含解谜、环境叙事与 Nano Banana 生成纹理的沉浸式 3D 城堡游戏;
  • 单次提示词构建出功能完整的 DOS 版谷歌地图,支持地点、路线与街景浏览;
  • 利用美国地质调查局真实数据集,生成著名地质遗址的实时剖面、二维投影与科学解释地形图;
  • Hardware Anatomy 交互式 3D 可视化工具,可自动将硬件设备分解为可爆炸查看的图层。

这些案例共同指向一个趋势:智能体编程正从“写代码片段”迈向“交付完整可运行产品”。

Gemini 3.8 Flash Cyber:把防御能力做成前沿水平

网络安全是本次发布的另一条主线。Gemini 3.8 Flash Cyber 通过新设立的 Fairwind Program 向受信任的防御方开放,强调在 Flash 级别的速度与成本下实现快速迭代。

自主漏洞发现

在行业标准漏洞发现基准 CyberGym 上,3.8 Flash Cyber 展现出前沿级性能,超越 3.5 Flash Cyber 及规模更大的前沿模型。更贴近真实防御需求的是,Google DeepMind 还构建了覆盖 20 种编程语言的内部综合基准,模型在其中实现了超过 70% 的成功率。

自动化补丁修复

与部分厂商优先发展攻击性能力不同,Google DeepMind 明确将漏洞修复置于更高优先级。在 Collinear 运营的 CWE-Bench 外部基准上,3.8 Flash Cyber 的 pass@1 达到 47.2%,与领先前沿模型的 47.8% 几乎持平,但成本显著更低,处于帕累托前沿。

真实场景验证

Chrome 安全团队发现,3.8 Flash Cyber 为 Chrome 漏洞生成正确补丁的数量,是规模大得多的最佳商用模型的 2.6 倍。Wiz 的测试则显示,其内部渗透测试召回率提升了 7.5% 至 9.7%。这些来自一线安全团队的反馈,比基准分数更具说服力。

国内视角:国产大模型在智能体编程与安全方向的进展

在智能体编程与代码生成赛道,国内厂商并未缺席。字节跳动的豆包大模型在代码补全与多轮工具调用上持续迭代;DeepSeek 系列以高性价比推理能力在开发者社区获得广泛关注;通义千问的 Qwen-Coder 系列在开源代码模型榜单中长期占据前列;智谱 GLM 与月之暗面 Kimi 也在长上下文与智能体任务上不断加码。

网络安全方向,国内安全厂商与大模型团队的合作正在加速。讯飞星火、文心一言等平台已推出面向代码审计与漏洞分析的行业方案,但在自主漏洞发现与自动化补丁生成的端到端闭环上,与 Google DeepMind 此次展示的 Fairwind Program 模式仍有差距。差异主要体现在两方面:一是高质量安全语料的积累与合规使用,二是与真实防御流程的深度集成。Gemini 3.8 Flash Cyber 选择优先发展修复而非攻击能力,这一取向对国内安全大模型的路线选择也有参考价值。

开发者该如何选择?

面对 3.7 Flash 与 3.8 Flash 并存的局面,决策逻辑并不复杂:

  • 若任务涉及长周期自主编程、复杂多步推理或专业领域分析,优先选用 3.8 Flash;
  • 若计算成本是首要约束,可降低努力级别或继续使用 3.7 Flash;
  • 若属于受信任防御方且有漏洞发现与修复需求,可申请 Fairwind Program 获取 3.8 Flash Cyber。

更多技术细节可参考 Google DeepMind 官方博客 与 Gemini 模型文档。

常见问题

Gemini 3.8 Flash 和 3.8 Flash Cyber 有什么区别?

两者共享同一底层智能核心。3.8 Flash 面向通用长周期编程与自主智能体任务,按 token 计费开放;3.8 Flash Cyber 专攻网络安全防御,通过 Fairwind Program 向受信任防御方开放,重点强化漏洞发现与自动化补丁修复。

Gemini 3.8 Flash 的定价是多少?

延续 3.7 Flash 的入门价格:每百万输入 token 0.75 美元,每百万输出 token 3.75 美元。

3.8 Flash 在编程基准上的表现如何?

在 DeepSWE v1.1 长周期软件工程基准上,它以远低于大型前沿模型的成本,端到端自主解决复杂工程问题;在 Vals Finance Agent V2 与 Harvey 法律智能体基准上也超越 3.7 Flash 及其他前沿模型。

什么是 Fairwind Program?

Fairwind Program 是 Google DeepMind 为受信任防御方设立的项目,用于开放 Gemini 3.8 Flash Cyber 的访问权限,帮助安全团队在 Flash 级速度与成本下进行漏洞发现与修复。

国内有哪些同类产品值得关注?

豆包大模型、DeepSeek 系列、通义千问 Qwen-Coder、智谱 GLM 与 Kimi 均在智能体编程方向持续迭代;安全方向则有讯飞星火、文心一言等平台推出代码审计与漏洞分析方案,但在端到端自动化补丁闭环上仍在追赶。

关于 Bingdada

Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。

编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com

© 2026 Bingdada. 保留所有权利。

目次

  • 一次发布,两条战线:Google DeepMind 把 Flash 系列推向新高度
  • 为什么 3.8 Flash 能在编程任务上逼近高成本前沿模型?
  • 实际演示:从 3D 游戏到 DOS 版谷歌地图
  • Gemini 3.8 Flash Cyber:把防御能力做成前沿水平
  • 自主漏洞发现
  • 自动化补丁修复
  • 真实场景验证
  • 国内视角:国产大模型在智能体编程与安全方向的进展
  • 开发者该如何选择?
  • 常见问题
  • Gemini 3.8 Flash 和 3.8 Flash Cyber 有什么区别?
  • Gemini 3.8 Flash 的定价是多少?
  • 3.8 Flash 在编程基准上的表现如何?
  • 什么是 Fairwind Program?
  • 国内有哪些同类产品值得关注?
  • 关于 Bingdada
post.faq
プレミアム広告枠 · 期間限定
広告募集中

ブランドを読者のフィードに

記事内広告枠は高い注意を集める場面で、新商品発表やイベント募集に最適です。

ビジネス相談

タグ

#网络安全#Google DeepMind#Gemini 3.8 Flash#智能体编程#自动化补丁
bingdada

bingdada

SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

関連記事

Google DeepMind 机器人加速器落地欧洲:具身智能从实验室走向物理世界的产业信号
AI人工智能

Google DeepMind 机器人加速器落地欧洲:具身智能从实验室走向物理世界的产业信号

Google DeepMind 在欧洲启动为期三个月的机器人加速器,支持 15 家具身智能初创企业,覆盖工业、医疗、建筑与海洋等场景,释放出物理 AI 从研究走向工程化落地的明确信号。

9月 15約 8 分で読めます
Gemini 智能体视频理解:让 AI 主动「挑着看」,成本直降三分之二
AI人工智能

Gemini 智能体视频理解:让 AI 主动「挑着看」,成本直降三分之二

Google DeepMind 为 Gemini 系列引入智能体视频理解,模型可自主决定看哪些片段、以何种帧率与模态检索,token 消耗最多降 88%、成本最多降 66%,准确率最高提升 7%。

9月 14約 6 分で読めます
当 AI 智能体学会「藏心思」:Google DeepMind 的纵深防御新思路
AI人工智能

当 AI 智能体学会「藏心思」:Google DeepMind 的纵深防御新思路

Google DeepMind 提出 AI Control Roadmap,在假设对齐可能失败的前提下,用系统级监控与实时拦截为智能体加上一层纵深防御。

9月 12約 8 分で読めます

ニュースレターを購読

最新の SEO・GEO 情報をお届けします。

プライバシーを尊重します。いつでも購読を解除できます。

コメント ({count}) (0)

ログインしてディスカッションに参加

ログイン登録
まだコメントがありません、最初の一言を