Bingdada 기술 블로그Bingdada 기술 블로그
홈블로그SEOGEOAEOAI도구소개
로그인회원가입
Logo

Bingdada 기술 블로그

SEO, GEO 및 미래 AI 트렌드에 초점을 맞춘 기술 블로그.

빠른 링크

  • 홈
  • 블로그 글
  • 소개

연락처

  • 398848662@qq.com

최신 SEO·GEO 정보를 받아볼래 뉴스레터를 구독하세요.

© 2024 Bingdada 技术博客. All rights reserved.

이 글은 간체 중국어입니다. 한국어(으)로 번역하려면 클릭하세요.
홈블로그国产 AI 前线当2亿智能体涌入日常:AI算力体系正面临一场结构性考验
当2亿智能体涌入日常:AI算力体系正面临一场结构性考验
国产 AI 前线

当2亿智能体涌入日常:AI算力体系正面临一场结构性考验

bingdadabingdada
9월 15, 202619회 읽음약 9분 분량
post.quickAnswer

当智能体从偶尔调用走向持续在线,算力消耗将呈现结构性膨胀。IDC预测2030年全球活跃智能体超过22亿,而万亿参数模型对显存带宽、节点通信和系统协同提出极高要求,传统芯片架构面临存储墙与功耗墙的双重制约。

post.keyTakeaways
  • IDC预测全球活跃智能体将从2025年的2860万个增长至2030年的22亿以上,算力需求呈结构性膨胀。
  • 智能体每任务Token消耗是标准聊天机器人的5到30倍,因为单次请求可能触发10到20次模型调用。
  • 万亿参数模型权重文件庞大,对显存带宽和节点间通信要求极高,互连效率直接影响实际算力利用率。
  • 传统冯·诺依曼架构面临存储墙与功耗墙,存算一体等新型架构成为行业关注方向。
  • 国内厂商在开源模型、推理框架和超节点标准等方向持续探索,推动算力从堆砌走向协同优化。
목차

목차

  • 从一场即将召开的行业聚会说起
  • 智能体为什么比聊天机器人“吃”得多
  • 万亿参数模型带来的连锁反应
  • 传统芯片架构遇到的两堵墙
  • 国内视角:算力供给的多元探索
  • 系统协同比单点突破更重要
  • 常见问题
  • 智能体为什么比普通聊天机器人消耗更多算力?
  • 万亿参数模型给算力系统带来了哪些挑战?
  • 存算一体为什么受到关注?
  • 国内在AI算力体系方面有哪些进展?
  • 智能体普及后,算力成本会如何变化?
  • 关于 Bingdada

从一场即将召开的行业聚会说起

2026年9月,北京中关村国际创新中心将迎来一场聚焦人工智能计算体系的专业会议。这场活动设置了主会场与多个分会场,议题覆盖芯片、存算、互连、系统、框架、基础设施与模型等多个层面。与以往偏重单点技术突破的会议不同,此次讨论的核心线索是一条正在快速膨胀的需求曲线:智能体(Agent)从偶尔调用走向持续在线之后,底层计算体系该如何重新设计。

这个问题的紧迫性,从一组数字就能看出来。IDC在《DAA研究报告》中给出了一条陡峭的增长轨迹:2025年全球活跃智能体约为2860万个,2026年预计接近8000万个,而到2030年这一数字可能攀升至22亿以上。当智能体数量以亿为单位计算,且每个智能体都可能在后台持续运行、反复推理、频繁调用工具时,算力消耗就不再是线性增长,而是呈现出一种结构性膨胀。

智能体为什么比聊天机器人“吃”得多

理解这场算力考验,需要先看清智能体的工作方式。普通聊天机器人通常是一次问答对应一次模型调用,而智能体完成一个任务往往需要多轮规划、推理与工具调用。根据Gartner在2026年3月发布的报告,一个智能体工作流每任务消耗的Token量可以达到标准聊天机器人的5到30倍,原因在于单次用户请求背后可能触发10到20次顺序模型调用。

高盛的分析进一步预测,到2030年全球Token消耗量将较2026年增长约24倍,达到每月约120000万亿Token的水平。对于持续在线的智能体而言,每天消耗超过10万Token可能成为常态。这些数字指向一个现实:智能体带来的便利,最终都要转化为底层计算体系上的负载。

万亿参数模型带来的连锁反应

Token消耗只是问题的一个侧面。支撑智能体运行的大模型本身也在快速膨胀,这对计算系统提出了更高要求。以近期备受关注的开源模型Kimi K3为例,其总参数量达到2.8T,激活参数量为104B,权重文件约1.56TB。普通AI服务器的GPU显存甚至难以完整加载权重,官方推荐扩展到64卡甚至更大规模才能满足部署需求。

即便硬件规模足够,系统效率仍然面临挑战。据SemiAnalysis的分析,K3每执行一次前向计算,仅HBM带宽需求就高达约1.5TB;896个专家需要分布到多张卡上,每次前向传播触发超过120次All-to-All通信。如果互连带宽和延迟跟不上,大量算力就会被消耗在等待数据搬运的过程中。此外,K3采用的线性注意力与全注意力混合架构,需要专门的融合算子、分块并行策略以及状态感知的缓存管理机制,未经优化的系统初始性能可能仅在10 tokens/s左右。

这说明,芯片算力是否足够只是问题的一部分,模型能否高效加载、数据能否快速搬运、多芯片能否协同工作,同样决定着智能体能否稳定运行。

传统芯片架构遇到的两堵墙

当智能体负载变长、并发增加、时延层层累积时,传统芯片架构面临“存储墙”与“功耗墙”的双重制约。在冯·诺依曼架构下,存储与计算分离,数据在两者之间反复搬运,功耗和时间大量消耗在传输路径上。而智能体负载恰恰对数据搬运效率格外敏感,这使得存算一体等新型架构成为行业关注的焦点。

清华大学副校长吴华强将在会议主论坛上讨论一个关键命题:存算一体能否重构计算架构,让计算在存储之处发生。这一方向如果取得突破,有望缓解数据搬运带来的功耗与延迟压力。与此同时,芯片多元化趋势也在加速,不同厂商、不同架构的芯片如何在同一系统中协同工作,成为软件与系统层必须回答的问题。

国内视角:算力供给的多元探索

在海外科技公司持续推进智能体产品的同时,国内厂商也在算力体系与模型效率方向展开布局。月之暗面推出的Kimi系列模型在开源社区引发广泛讨论,其K3版本在发布后短时间内因算力逼近极限而暂停新用户订阅,这一事件从侧面反映出模型规模扩张与算力供给之间的紧张关系。

与此同时,浪潮信息、百度智能云、曦智科技等国内企业正在开放超节点、推理基础设施等方向投入力量。SGLang等开源推理框架的核心贡献者也参与到相关议题的讨论中,关注如何通过Kernel优化、缓存管理和调度策略降低智能体推理的时延与成本。GPUStack、硅基流动、清程极智、PPIO等团队则从推理供给的商业闭环角度切入,探索算力转化为稳定Token输出的可行路径。

这些探索与海外方向形成呼应:智能体越普及,算力体系就越需要从“堆得更多”走向“用得更好”。

系统协同比单点突破更重要

面对持续增长的Token需求,单纯增加芯片数量已经不足以解决问题。行业需要更高效的模型框架、更开放的芯片互连标准,以及更深入的算子优化,把底层算力转化为更快、更稳定、更低成本的Token输出。

从系统侧看,浪潮信息首席AI战略官刘军将回应算力如何通过开放多元的系统架构,以及计算、互连、存储、软件的协同创新,让每一份算力算得其效、算尽其用。在模型侧,AI Infra论坛将讨论大模型推理的基础设施重构问题,SGLang核心贡献者张晓雨也将在主会场分析Agentic Inference如何通过Kernel、缓存和调度降低时延与成本。

这些议题共同指向一个判断:智能体从一次调用走向持续任务链之后,下一代AI计算体系需要在芯片、存算、互连、系统、框架、基础设施等多个层面同步演进。任何一个环节的短板,都可能成为整个系统效率的瓶颈。

对于关注AI基础设施的从业者而言,这场会议提供了一个观察行业走向的窗口。智能体全民化的趋势已经不可逆转,而支撑这场洪流的计算底座,正在经历一场从架构到生态的深层调整。

常见问题

智能体为什么比普通聊天机器人消耗更多算力?

普通聊天机器人通常一次问答对应一次模型调用,而智能体完成一个任务往往需要多轮规划、推理与工具调用。Gartner报告显示,一个智能体工作流每任务消耗的Token量可以达到标准聊天机器人的5到30倍,因为单次用户请求背后可能触发10到20次顺序模型调用。

万亿参数模型给算力系统带来了哪些挑战?

万亿参数模型的权重文件体积庞大,普通AI服务器显存难以完整加载,需要扩展到多卡甚至超节点规模。同时,模型对显存带宽和节点间通信要求极高,如果互连带宽和延迟跟不上,大量算力会被消耗在数据搬运上,导致实际推理效率远低于理论值。

存算一体为什么受到关注?

传统冯·诺依曼架构下存储与计算分离,数据在两者之间反复搬运,功耗和时间大量消耗在传输路径上。智能体负载对数据搬运效率格外敏感,因此存算一体等新型架构被视为缓解“存储墙”与“功耗墙”的潜在方向。

国内在AI算力体系方面有哪些进展?

国内厂商在开源模型、推理框架、超节点标准等方向持续投入。Kimi系列模型在开源社区引发关注,浪潮信息、百度智能云、曦智科技等企业在开放超节点方向展开探索,SGLang等开源推理框架的核心贡献者也参与到推理基础设施的重构讨论中。

智能体普及后,算力成本会如何变化?

高盛预测到2030年全球Token消耗量将较2026年增长约24倍。持续在线的智能体每天Token消耗可能超过10万,这意味着算力成本控制将成为智能体规模化落地的关键约束之一。行业需要通过模型框架优化、芯片互连开放和算子优化等系统创新来降低单位Token成本。

关于 Bingdada

Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。

编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com

© 2026 Bingdada. 保留所有权利。

목차

  • 从一场即将召开的行业聚会说起
  • 智能体为什么比聊天机器人“吃”得多
  • 万亿参数模型带来的连锁反应
  • 传统芯片架构遇到的两堵墙
  • 国内视角:算力供给的多元探索
  • 系统协同比单点突破更重要
  • 常见问题
  • 智能体为什么比普通聊天机器人消耗更多算力?
  • 万亿参数模型给算力系统带来了哪些挑战?
  • 存算一体为什么受到关注?
  • 国内在AI算力体系方面有哪些进展?
  • 智能体普及后,算力成本会如何变化?
  • 关于 Bingdada
post.faq
프리미엄 광고 영역 · 한정 기간
광고 문의

브랜드를 독자의 피드에 올리세요

본문 내 광고 영역은 높은 주목도를 가진 순간으로, 신제품 출시와 이벤트 모집에 적합합니다.

비즈니스 문의

태그

#AI智能体#AI基础设施#新智元#算力体系#存算一体
bingdada

bingdada

SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

관련 글

国产大模型进入资本密集期:智谱50亿美元融资背后的自训练路线图
国产 AI 前线

国产大模型进入资本密集期:智谱50亿美元融资背后的自训练路线图

智谱完成约50亿美元融资,六成资金投向下一代GLM与完全自训练体系,探索递归式自我改进循环。本文拆解其资金结构、技术路线与国产大模型资本竞赛的深层逻辑。

9월 14약 7분 분량
当AI开始“批量解题”:25位菲尔兹奖得主为何集体向大模型发难
国产 AI 前线

当AI开始“批量解题”:25位菲尔兹奖得主为何集体向大模型发难

25位菲尔兹奖得主联合发声,矛头指向AI企业把解题当基准的做法。从88小时速通纳维-斯托克斯方程到优先权争议,这场冲突揭示的是效率逻辑与数学传承之间的深层错位。

9월 13약 8분 분량
AI视频生成提速12倍:MiniMax H3开源加速方案如何重塑创作节奏
国产 AI 前线

AI视频生成提速12倍:MiniMax H3开源加速方案如何重塑创作节奏

RunningHub 开源的 H3 Lightning 方案,把 MiniMax H3 视频生成耗时从近 6 分钟压到 28.7 秒,提速约 12 倍。本文拆解其步数压缩、算子优化与多卡并行三层逻辑,并观察国内视频模型加速生态的走向。

9월 12약 6분 분량

뉴스레터 구독

최신 SEO·GEO 정보를 받아보세요.

개인정보를 존중합니다. 언제든 구독을 취소할 수 있습니다.

댓글 ({count}) (0)

로그인하여 토론에 참여하세요

로그인가입
아직 댓글이 없습니다. 첫 댓글을 작성해 주세요