
谷歌 DeepMind 发布的 Gemini 3.6 Flash 通过减少 17% 的输出 Token 消耗和降低定价,在提升编码、知识工作等性能的同时,显著降低了 AI 代理的构建与运行成本。
在 AI 代理(Agent)从概念验证走向生产环境的关键阶段,开发者面临的核心矛盾始终是:如何在保证质量的同时,控制成本与延迟。谷歌近期发布的 Gemini 3.6 Flash、3.5 Flash-Lite 以及 3.5 Flash Cyber 三款模型,正是针对这一痛点给出的最新答案。从 DeepMind 团队的技术路线看,这一代模型的升级焦点已从单纯的参数规模竞赛,转向了更深层次的工程效率优化——即用更少的 Token 和推理步骤完成更复杂的任务。
过去一年,AI 行业的竞争焦点逐渐从模型智商转向了落地成本。对于运行高频生产流量的企业而言,输出 Token 的消耗量直接决定了利润率。谷歌此次发布的 Gemini 3.6 Flash 被定位为“工作horse”(主力干将)模型,其核心卖点并非单一的基准分数提升,而是效率与质量的双重突破。
根据 Artificial Analysis 的独立评测指数,3.6 Flash 在完成同等任务时,输出 Token 消耗比前代 3.5 Flash 减少了 17%。在 Datacurve 的 DeepSWE 编码基准测试中,这一优势甚至扩大到 65%。这意味着开发者在处理多步骤工作流时,模型所需的推理步骤和工具调用次数显著减少,直接降低了 API 调用成本。
这种效率提升并非以牺牲性能为代价。数据显示,3.6 Flash 在 MLE Bench(机器学习研究)上得分从 49.7% 跃升至 63.9%,在 OSWorld-Verified 计算机使用测试中达到 83.0%(前代为 78.4%)。更值得注意的是,其定价降至每百万输入 Token 1.5 美元、每百万输出 Token 7.5 美元,比前代更低。从 Google DeepMind 官方博客 披露的信息看,这种“降价提质”的策略,意在降低构建复杂 AI 代理系统的准入门槛。
除了主力型号,谷歌还同步更新了轻量级产品线。Gemini 3.5 Flash-Lite 以每秒 350 个输出 Token 的速度成为 3.5 系列中响应最快的模型,定价仅为每百万输入 Token 0.3 美元。这一配置瞄准的是对延迟极度敏感的实时交互场景,以及文档批量处理等高吞吐量任务。在 Terminal-Bench 2.1 编码测试中,它的得分从 31% 提升至 54%,证明轻量模型同样具备处理复杂代理任务的能力。
值得关注的是,谷歌在专业安全领域迈出了差异化的一步。针对网络安全应用,3.5 Flash Cyber 模型被嵌入到 CodeMender 代码安全代理中。这一组合的思路在于:将高度专业化的模型与代理基础设施协同编排,而非仅仅依赖通用大模型的泛化能力。这种“专用模型+专用工具”的模式,可能成为未来垂直行业 AI 落地的范本。
在能力提升的同时,模型安全性并未被忽视。3.6 Flash 内置了针对化学、生物、放射性和核威胁(CBRN)以及网络攻击滥用的前沿安全防护,显著增强了抗越狱能力,同时通过训练优化减少了对合法请求的误拒。这种平衡策略对于企业级部署尤为重要。
从国内视角看,这一系列发布也折射出行业趋势。百度文心一言、阿里通义千问、DeepSeek 等国内模型近期也在强调“性价比”与“工具调用效率”。例如,DeepSeek 在推理成本控制上的激进策略,与谷歌 Flash 系列追求 Token 效率的思路不谋而合。不过,国内厂商在计算机使用(Computer Use)这类端侧代理能力上,公开演示的成熟度仍与谷歌存在差距,这或许将是下一阶段竞争的关键点。
谷歌透露,Gemini 3.5 Pro 正在与合作伙伴进行测试,而下一代 Gemini 4 的大规模预训练已经启动。从这一节奏看,谷歌试图通过“Flash 系列快速迭代+Pro 系列稳扎稳打”的双轨策略,在保持技术领先的同时,确保商业化落地的连贯性。对于开发者而言,现在或许是评估将现有工作流迁移至 3.6 Flash 的最佳时机——其更低的成本与更高的效率,可能带来立竿见影的 ROI 改善。
主要在效率与成本的平衡上。3.6 Flash 在 Artificial Analysis 指数上输出 Token 消耗减少 17%,在 DeepSWE 编码任务中最高减少 65%,同时定价更低(每百万输出 Token 7.5 美元),且在编码、计算机使用、知识工作等多项基准上均有明显性能提升。
适合对延迟敏感或需要高吞吐量的任务,例如代理搜索、文档批量处理、实时交互等。它以每秒 350 个输出 Token 的速度成为 3.5 系列最快模型,定价仅每百万输入 Token 0.3 美元,且支持通过不同思考级别(Thinking Level)灵活配置延迟与成本。
3.5 Flash Cyber 是谷歌新推出的高效专用网络安模型,CodeMender 是配套的代码安全代理。两者组合通过模型与代理基础设施的协同编排,在网络安全任务上提供了具有竞争力的表现,而非仅依赖单一模型的泛化能力。
3.6 Flash 内置了增强的前沿安全防护措施,重点覆盖化学、生物、放射性和核威胁(CBRN)以及网络攻击滥用领域,显著提升了抗越狱能力。同时,模型经过训练以最小化对合法有益请求的拒绝,确保安全与可用性的平衡。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

Omarchy 4.0 尝试将 AI 从应用层下沉到系统层,让自然语言成为人机交互的核心协议。文章分析了其技术理念、八位硅谷巨头的 800 万美元注资背后的战略意义,以及社区驱动的插件生态爆发,并对比了国内 AI 与操作系统融合的渐进式路径。

Google DeepMind 发布轻量级网络安全模型 Gemini 3.5 Flash Cyber,通过低成本高频扫描重塑漏洞发现模式。实测在 Chrome 等复杂代码库中表现优异,初期仅向政府与受信任伙伴开放,为防御者争取宝贵时间窗口。

Google DeepMind 十五年的游戏 AI 研究正从征服游戏转向理解游戏世界。本文回顾了从 Atari 到 SIMA 智能体的演进,探讨了与开发者共创的新范式,并对比了国内厂商的差异化路径。
최신 SEO·GEO 정보를 받아보세요.
개인정보를 존중합니다. 언제든 구독을 취소할 수 있습니다.