
当智能体从偶尔调用走向持续在线,算力消耗将呈现结构性膨胀。IDC预测2030年全球活跃智能体超过22亿,而万亿参数模型对显存带宽、节点通信和系统协同提出极高要求,传统芯片架构面临存储墙与功耗墙的双重制约。
2026年9月,北京中关村国际创新中心将迎来一场聚焦人工智能计算体系的专业会议。这场活动设置了主会场与多个分会场,议题覆盖芯片、存算、互连、系统、框架、基础设施与模型等多个层面。与以往偏重单点技术突破的会议不同,此次讨论的核心线索是一条正在快速膨胀的需求曲线:智能体(Agent)从偶尔调用走向持续在线之后,底层计算体系该如何重新设计。
这个问题的紧迫性,从一组数字就能看出来。IDC在《DAA研究报告》中给出了一条陡峭的增长轨迹:2025年全球活跃智能体约为2860万个,2026年预计接近8000万个,而到2030年这一数字可能攀升至22亿以上。当智能体数量以亿为单位计算,且每个智能体都可能在后台持续运行、反复推理、频繁调用工具时,算力消耗就不再是线性增长,而是呈现出一种结构性膨胀。
理解这场算力考验,需要先看清智能体的工作方式。普通聊天机器人通常是一次问答对应一次模型调用,而智能体完成一个任务往往需要多轮规划、推理与工具调用。根据Gartner在2026年3月发布的报告,一个智能体工作流每任务消耗的Token量可以达到标准聊天机器人的5到30倍,原因在于单次用户请求背后可能触发10到20次顺序模型调用。
高盛的分析进一步预测,到2030年全球Token消耗量将较2026年增长约24倍,达到每月约120000万亿Token的水平。对于持续在线的智能体而言,每天消耗超过10万Token可能成为常态。这些数字指向一个现实:智能体带来的便利,最终都要转化为底层计算体系上的负载。
Token消耗只是问题的一个侧面。支撑智能体运行的大模型本身也在快速膨胀,这对计算系统提出了更高要求。以近期备受关注的开源模型Kimi K3为例,其总参数量达到2.8T,激活参数量为104B,权重文件约1.56TB。普通AI服务器的GPU显存甚至难以完整加载权重,官方推荐扩展到64卡甚至更大规模才能满足部署需求。
即便硬件规模足够,系统效率仍然面临挑战。据SemiAnalysis的分析,K3每执行一次前向计算,仅HBM带宽需求就高达约1.5TB;896个专家需要分布到多张卡上,每次前向传播触发超过120次All-to-All通信。如果互连带宽和延迟跟不上,大量算力就会被消耗在等待数据搬运的过程中。此外,K3采用的线性注意力与全注意力混合架构,需要专门的融合算子、分块并行策略以及状态感知的缓存管理机制,未经优化的系统初始性能可能仅在10 tokens/s左右。
这说明,芯片算力是否足够只是问题的一部分,模型能否高效加载、数据能否快速搬运、多芯片能否协同工作,同样决定着智能体能否稳定运行。
当智能体负载变长、并发增加、时延层层累积时,传统芯片架构面临“存储墙”与“功耗墙”的双重制约。在冯·诺依曼架构下,存储与计算分离,数据在两者之间反复搬运,功耗和时间大量消耗在传输路径上。而智能体负载恰恰对数据搬运效率格外敏感,这使得存算一体等新型架构成为行业关注的焦点。
清华大学副校长吴华强将在会议主论坛上讨论一个关键命题:存算一体能否重构计算架构,让计算在存储之处发生。这一方向如果取得突破,有望缓解数据搬运带来的功耗与延迟压力。与此同时,芯片多元化趋势也在加速,不同厂商、不同架构的芯片如何在同一系统中协同工作,成为软件与系统层必须回答的问题。
在海外科技公司持续推进智能体产品的同时,国内厂商也在算力体系与模型效率方向展开布局。月之暗面推出的Kimi系列模型在开源社区引发广泛讨论,其K3版本在发布后短时间内因算力逼近极限而暂停新用户订阅,这一事件从侧面反映出模型规模扩张与算力供给之间的紧张关系。
与此同时,浪潮信息、百度智能云、曦智科技等国内企业正在开放超节点、推理基础设施等方向投入力量。SGLang等开源推理框架的核心贡献者也参与到相关议题的讨论中,关注如何通过Kernel优化、缓存管理和调度策略降低智能体推理的时延与成本。GPUStack、硅基流动、清程极智、PPIO等团队则从推理供给的商业闭环角度切入,探索算力转化为稳定Token输出的可行路径。
这些探索与海外方向形成呼应:智能体越普及,算力体系就越需要从“堆得更多”走向“用得更好”。
面对持续增长的Token需求,单纯增加芯片数量已经不足以解决问题。行业需要更高效的模型框架、更开放的芯片互连标准,以及更深入的算子优化,把底层算力转化为更快、更稳定、更低成本的Token输出。
从系统侧看,浪潮信息首席AI战略官刘军将回应算力如何通过开放多元的系统架构,以及计算、互连、存储、软件的协同创新,让每一份算力算得其效、算尽其用。在模型侧,AI Infra论坛将讨论大模型推理的基础设施重构问题,SGLang核心贡献者张晓雨也将在主会场分析Agentic Inference如何通过Kernel、缓存和调度降低时延与成本。
这些议题共同指向一个判断:智能体从一次调用走向持续任务链之后,下一代AI计算体系需要在芯片、存算、互连、系统、框架、基础设施等多个层面同步演进。任何一个环节的短板,都可能成为整个系统效率的瓶颈。
对于关注AI基础设施的从业者而言,这场会议提供了一个观察行业走向的窗口。智能体全民化的趋势已经不可逆转,而支撑这场洪流的计算底座,正在经历一场从架构到生态的深层调整。
普通聊天机器人通常一次问答对应一次模型调用,而智能体完成一个任务往往需要多轮规划、推理与工具调用。Gartner报告显示,一个智能体工作流每任务消耗的Token量可以达到标准聊天机器人的5到30倍,因为单次用户请求背后可能触发10到20次顺序模型调用。
万亿参数模型的权重文件体积庞大,普通AI服务器显存难以完整加载,需要扩展到多卡甚至超节点规模。同时,模型对显存带宽和节点间通信要求极高,如果互连带宽和延迟跟不上,大量算力会被消耗在数据搬运上,导致实际推理效率远低于理论值。
传统冯·诺依曼架构下存储与计算分离,数据在两者之间反复搬运,功耗和时间大量消耗在传输路径上。智能体负载对数据搬运效率格外敏感,因此存算一体等新型架构被视为缓解“存储墙”与“功耗墙”的潜在方向。
国内厂商在开源模型、推理框架、超节点标准等方向持续投入。Kimi系列模型在开源社区引发关注,浪潮信息、百度智能云、曦智科技等企业在开放超节点方向展开探索,SGLang等开源推理框架的核心贡献者也参与到推理基础设施的重构讨论中。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

智谱完成约50亿美元融资,六成资金投向下一代GLM与完全自训练体系,探索递归式自我改进循环。本文拆解其资金结构、技术路线与国产大模型资本竞赛的深层逻辑。

25位菲尔兹奖得主联合发声,矛头指向AI企业把解题当基准的做法。从88小时速通纳维-斯托克斯方程到优先权争议,这场冲突揭示的是效率逻辑与数学传承之间的深层错位。

RunningHub 开源的 H3 Lightning 方案,把 MiniMax H3 视频生成耗时从近 6 分钟压到 28.7 秒,提速约 12 倍。本文拆解其步数压缩、算子优化与多卡并行三层逻辑,并观察国内视频模型加速生态的走向。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。