
谷歌DeepMind正将Gemini从聊天机器人重塑为能自主执行任务的AI智能体。其核心战略是以编程能力为突破口,通过工具调用和工作流执行,让AI从提供答案转向帮助用户完成任务,这将深刻改变谷歌搜索的未来形态。
当业界还在争论大语言模型的参数规模时,谷歌 DeepMind 团队已经为下一代人工智能划定了新的起跑线:不再满足于让模型“会说话”,而是要让它“会办事”。这种从聊天机器人(Chatbot)向智能体(Agent)的范式转移,正在重塑谷歌搜索乃至整个产品生态的底层逻辑。
谷歌 DeepMind 首席 AI 架构师 Koray Kavukcuoglu 近期在接受采访时透露,团队内部对 Gemini 的定位已发生根本性变化。他明确指出,Gemini 早已超越了传统聊天机器人的范畴,正逐步演化为能够自主执行任务的 AI 智能体。这一转变的深层动因,源于对软件工程领域的深耕。
在 Kavukcuoglu 看来,编程是通往智能体世界的钥匙。代码编写不仅仅是一项技能,它代表了人类与机器协作的极致形态:明确的目标、结构化的任务、即时的反馈以及复杂的工具调用。正是通过对编码场景的反复训练,谷歌团队才真正理解了如何让模型进行“工具使用”和“工作流执行”。
从“3.0 到 3.7”的迭代轨迹来看,谷歌的野心并非只是提升问答准确率。 其核心目标在于构建一个能代表用户、陪伴用户采取行动的实体。这种从“模型”到“智能体”的跨越,意味着 AI 需要具备意图推断、处理模糊指令以及与人类无缝协作的能力。
值得注意的是,尽管外界普遍认为 AI 领域正经历翻天覆地的变革,但 Kavukcuoglu 却提出了一个颇具辩证色彩的观点:AI 能做的事是革命性的,但实现这一目标的技术路径并未发生颠覆式改变。
当前谷歌依然依赖深度学习、预训练、强化学习等经典技术框架。真正发生变化的是 AI 所处的“环境”。随着应用场景从简单的问答扩展到复杂的办公协作,模型必须适应更开放、更动态的现实世界。这种环境压力反过来倒逼模型在推理能力和交互方式上进行深度优化。
这种“以不变应万变”的策略,解释了为何谷歌在 Gemini 3.5 之后的版本中,能够迅速将在智能体工作流方面的学习成果整合进新模型。Kavukcuoglu 强调,许多在 3.6、3.7 版本中展现的能力,其实源于一年前甚至更早的技术储备。这种多轨并行的研发模式,确保了技术积累能在恰当的时机转化为产品体验的质变。
在竞争激烈的 AI 赛道,前沿的定义权总是处于动态变化之中。Kavukcuoglu 坦言,虽然 Gemini 3 曾一度触及前沿,但随后行业的焦点迅速转向了智能体编码和类智能体能力。这意味着谷歌不仅要应对模型能力的竞赛,更要应对智能体交互范式的竞赛。
通过对 Gemini 3.5 研发过程的复盘,谷歌团队对“人类如何与智能体协作”有了更深刻的理解。Kavukcuoglu 表示,他现在对团队在理解用户需求方面的能力感到“非常非常非常满意”,尤其是在用户与智能体共同处理复杂任务或工作流时。这种自信并非空穴来风,它建立在对海量真实交互数据的分析与建模之上。
从 Gmail 的自动撰写到 Google Sheets 的数据处理,再到地图导航的路线规划,谷歌的所有产品本质上都是帮助用户完成任务。Kavukcuoglu 的表述揭示了一个清晰的战略意图:将这种“完成任务”的基因注入 AI 模型,让搜索不仅提供答案,更提供解决方案。 这正如 Search Engine Journal 所分析的,AI 搜索的下一步竞争焦点,正在从信息检索转向任务执行。
当被问及如果拥有一根“魔法棒”最想提升 AI 的哪项能力时,Kavukcuoglu 的回答简单而深刻:“让它们更聪明。”他认为,只要模型变得更智能,它们在所有任务上的表现都会更直觉化、更出色。
这一回答折射出谷歌 DeepMind 对通用人工智能(AGI)的长期追求。在技术演进的道路上,无论是多模态融合还是推理能力的增强,最终都指向一个目标:让 AI 成为人类更强大的延伸。
谷歌对智能体的押注,与国内科技巨头的布局不谋而合。百度文心一言已明确将“智能体”作为战略重点,推出了面向行业应用的智能体开发平台;阿里通义千问则在代码生成和开发工具链上持续发力,试图复刻“编程即智能体入口”的路径。
值得注意的是,国内厂商在智能体的落地场景上更侧重于具体行业解决方案。例如,字节跳动的豆包和月之暗面的 Kimi 都在探索 AI 如何通过插件生态和 API 调用,在办公、教育等垂直领域完成闭环任务。与谷歌强调的“通用智能体”不同,国内产品在 C 端用户习惯培养和 B 端降本增效方面展现出了更强的执行力。这种差异并非技术代差,更多是基于不同市场需求的策略选择。
谷歌 Gemini 正从聊天机器人向 AI 智能体演进,其核心目标不仅是回答问题,更是通过工具调用和工作流执行来帮助用户完成任务。而 ChatGPT 虽然也在推进智能体功能,但 Gemini 的转型深度与谷歌搜索引擎、办公套件的生态整合更为紧密。
编程场景具备目标明确、反馈即时、工具链复杂的特点,是训练 AI 进行逻辑推理、任务分解和工具调用的最佳环境。谷歌认为,掌握了软件工程能力的 AI,才真正具备了解决复杂问题的通用基础。
未来的搜索将不再局限于返回蓝色链接,而是直接生成解决方案。用户提出意图后,AI 智能体可以自主规划步骤、调用相关应用(如日历、邮件、地图)并执行操作,搜索将演变为“任务完成引擎”。
国内的百度文心智能体平台、阿里通义千问的代码模式、字节豆包以及月之暗面的 Kimi 都在积极布局智能体能力。它们更侧重于结合国内用户的习惯,在办公、教育、电商等具体场景中实现 AI 的落地应用。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

当智能体从偶尔调用走向持续在线,算力消耗呈现结构性膨胀。本文从IDC增长数据出发,分析万亿参数模型对计算体系的连锁影响,以及芯片、存算、互连、系统协同面临的现实考验。

谷歌通过Search Console测试AI内容分账,当网站内容在Gemini、AI Overviews和AI Mode的回答生成中发挥实质作用时向发布者付费。试点覆盖范围、黑箱式面板、发布者反馈及国内同类探索,本文逐一拆解。

Google DeepMind 为 Gemini 系列引入智能体视频理解,模型可自主决定看哪些片段、以何种帧率与模态检索,token 消耗最多降 88%、成本最多降 66%,准确率最高提升 7%。
獲取最新的 SEO 與 GEO 技術資訊。
我們尊重您的隱私,隨時可以取消訂閱。