
端侧AI的竞争重心正从「模型能否装进手机」转向「智能体能否跑通完整工作流」。芯片厂商通过异构计算、多模型协作和生态整合来支撑这一转变,但模型迭代速度、成本控制和跨终端协作仍是主要挑战,个人智能体的稳定落地预计在2027至2028年。
过去两年,行业对端侧大模型的讨论大多围绕一个技术指标展开——参数量。7B、13B、30B,数字不断攀升,仿佛只要模型够大,手机就能变成AI助手。但真正用过端侧AI的人都知道,能跑起来和能干活之间,隔着一道不小的鸿沟。
2026年骁龙峰会释放的信号表明,芯片厂商的叙事重心正在从「模型部署」转向「任务闭环」。一个被反复提及的演示场景是:完全依靠本地算力,AI读取邮件、提取行程、同步日历、检索航班酒店并草拟回复。这条链路涉及理解、规划和连续执行,而非单次问答。它意味着端侧AI开始触碰真实工作流,而不仅仅是演示demo。
高通公司总裁兼首席执行官安蒙(Cristiano Amon)在主题演讲中的判断是,智能体AI带来的不是终端功能的简单叠加,而是一种全新终端工作流程的诞生。这句话背后的潜台词是:芯片的设计目标变了。
如果拆解第六代骁龙8至尊版与超级至尊版双旗舰的架构思路,会发现一个明显变化——计算资源的分配逻辑不再围绕单次推理优化,而是为持续运行的任务流设计。
两款旗舰均采用2nm工艺,超级至尊版频率拉升至5GHz。但更值得关注的是异构分工的细化:CPU负责工具调用与任务调度,NPU承担模型推理,低功耗感知单元处理后台信息。这种分工解决的是一个核心矛盾——智能体需要常驻,但手机不能因此发烫或迅速耗电。
与2025年第五代骁龙8至尊版引入的Personal Scribe和个人知识图谱相比,今年的升级集中在缓存容量、NPU共享内存和感知能力上。这些参数听起来不够性感,却直接决定了智能体能否在任务切换时保持上下文、能否在后台等待时机而不被系统杀掉。
双Micro NPU架构的性能提升85%、功耗降低20%,这组数据指向一个务实的目标:让本地处理低时延、离线可用,同时减少数据上传。但高通并未把所有计算压在端侧——复杂任务仍可调用云端,终端承担的是更有价值的那部分。
从2024年端侧最多部署7B模型,到如今30B MoE模型在参考设计上跑通完整办公流程,这个跨越的意义不在于数字本身,而在于它验证了一种可能性:更复杂的AI应用可以由多个模型分工完成,而非依赖单一模型无限膨胀。
一个值得注意的案例是Deepgram展示的AI播客应用。NPU上的语音模型负责转写并区分发言者,GPU上的Gemma模型理解话题、生成追问建议。一边听清谁说了什么,一边判断接下来该问什么——这种异构计算的分工模式,为应用生态创业者提供了新的产品思路。
智能眼镜是另一个观察窗口。2025年AWE上,骁龙AR1+ Gen 1已用原型眼镜演示Llama 3.2-1B本地运行,强调芯片更小、功耗更低以适应镜腿和电池约束。今年,AR1、AR1+进一步支持多模态1比特模型。高通START计划提供AR1+模组、软件平台和参考设计,降低了非科技厂商的集成门槛。这种策略的实质是:不把手机芯片简单缩小,而是针对品类需求提供研发支持。
芯片厂商面临的一个现实挑战是:大模型的迭代节奏远快于手机换代。高通公司中国区董事长孟樸对包括在内的媒体表示,过去智能手机完成适配后可能9到12个月无需调整,而现在大模型每3个月甚至更短时间就会迭代一次。
这意味着,芯片厂商不能只做模型发布后的适配工作,而需要将合作前移到模型设计环节。2026年展示的四方合作分工印证了这一趋势:高通提供计算平台,阶跃提供模型,无量火优化推理与调度,江波龙处理存储协同。AI Hub则试图复用优化成果、降低部署门槛。
新的竞争指标变得清晰:新模型出来后,谁能更快、以更可控的成本交付可用体验。这不再是单纯的算力竞赛,而是软件调度、可配置能力和持续验证的综合较量。
端侧智能体是整个市场都在追逐的方向。联发科天玑9600 Pro同样采用2nm,强调低功耗常驻感知,宣称支持30B MoE端侧运行。竞争在芯片厂商之间展开的同时,客户一侧的动作也值得关注:小米玄戒O1进入量产,苹果在iPhone 16e上推出自研C1基带。进入数据中心市场,高通还面临与客户和竞争对手身份重叠的复杂局面。
孟樸提到的一个现实问题是,随着技术进步,芯片中需要叠加的技术越来越多,成本也会因此越来越高。一款产品展示技术上限,另一款注重效率以应对高成本、支持终端厂商——这种双旗舰策略本身就是对成本命题的回应。
一位半导体行业人士的总结颇为直白:智能体不能做错任务,不能过度占用内存,不能增加续航负担,起码不能比手动操作还慢。这些约束条件决定了,端侧智能体的落地不是一蹴而就的过程。孟樸的判断是,跨终端持续服务的个人智能体可能到2027至2028年才会比较稳定地逐步落地。
在端侧AI这条赛道上,国内厂商的推进节奏同样值得关注。模型层面,DeepSeek系列持续优化推理效率,为端侧部署提供了更多可能性;通义千问、文心一言、豆包、Kimi等产品在移动端的渗透率不断提升,智谱GLM和讯飞星火也在探索端云协同的落地方式。
与高通主导的芯片-模型-应用垂直整合路径不同,国内厂商更倾向于通过开放平台和开发者生态来推动端侧智能体落地。这种差异背后是市场结构的不同:国内手机厂商对芯片自研的投入力度更大,模型厂商与应用厂商之间的边界也更模糊。可以预见,端侧智能体的竞争将不只是芯片算力的比拼,更是生态整合能力的较量。
端侧AI指模型直接在手机、PC、眼镜等终端设备上运行,优点是低时延、离线可用、数据不上传;云端AI依赖远程服务器,适合复杂任务和大规模计算。当前趋势是端云协同,终端处理高价值、隐私敏感的部分,复杂任务调用云端。
MoE(混合专家)架构允许模型在推理时只激活部分参数,从而降低计算量。30B MoE在端侧跑通意味着手机可以处理更复杂的多步骤任务,如邮件理解、行程规划和日历同步,而不再局限于单次问答或图片处理。
根据高通公司中国区董事长孟樸的判断,跨终端持续服务的个人智能体可能到2027至2028年才会比较稳定地逐步落地。当前阶段仍处于能力验证和生态建设期,芯片、模型、应用三方的协作模式还在磨合中。
主要挑战包括:大模型迭代速度远快于芯片适配周期,合作需要前移到模型设计环节;成本持续上升,需要在技术上限和客户可负担性之间平衡;竞争边界扩大,同时面对芯片同行、自研芯片的客户以及数据中心市场的交叉竞争。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
Put your brand in the reader feed
In-article ad slots: high-attention moments perfect for product launches and event recruitment.
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

微软将聊天、编程、智能体整合为新版 Copilot 超级应用,重新定义 AI 时代工作入口。与此同时,国产大模型走出一条差异化路径,苹果端侧 AI 与马斯克算力扩张也在重塑行业格局。

联想天禧AI在2026云栖大会展示全场景端侧AI矩阵,提出“人+Agent”取代传统团队成为最小生产单元,AI主机解决Agent连续性瓶颈,天禧AI 4.3将超级组织理念落地为可感知的日常体验。

本周科技圈呈现两条主线:长鑫第五代存储平台量产推动国产供应链升级,苹果 iOS 27 调休闹钟则代表国际厂商加速本土化。小米 18 Pro 背屏交互与端侧 AI 算力竞赛同样值得关注。
Get the latest SEO & GEO insights.
We respect your privacy. You can unsubscribe at any time.