
趋境科技与摩尔线程通过战略合作,将自研国产 PD 异构技术与 MTT S5000 智算卡深度融合,对推理的 Prefill 与 Decode 阶段进行资源优化,在生产环境中实现了性价比超越国际先进算力方案的高品质 AI Token 产出。
大模型应用的商业化进程正将基础设施的竞争推向新阶段。当行业目光从单一芯片的峰值算力转向系统级的 Token 生产效率时,如何平衡性能与成本便成为关键命题。近期,趋境科技与摩尔线程的战略合作,为这一命题提供了来自国产技术路线的实践样本。
在规模化商业落地阶段,衡量一套算力方案的价值,不再仅仅取决于其能否运行大型模型,更在于在满足既定服务标准的前提下,每一枚高品质 AI Token 的生产成本。这一视角的转变,将竞争从硬件规格比拼拉入到系统工程优化的深水区。趋境科技与摩尔线程的联合方案,其性价比优势并非源于硬件定价策略,而是来自对推理过程中两个核心阶段——Prefill(预填充)与 Decode(解码)——的精细化资源管理。
该方案的核心技术逻辑在于 PD 分离与异构协同。具体而言,由摩尔线程 MTT S5000 智算卡承担 Prefill 阶段的计算密集型任务,负责处理输入序列并生成 KV Cache;而 Decode 阶段则交由高带宽 GPU 负责,专注于逐 Token 的生成。这种分工模式避免了为单一阶段的峰值需求而配置整套昂贵基础设施的浪费。
摩尔线程 MTT S5000 凭借其高密度 AI 算力与原生 FP8 精度支持,结合 MUSA 软件平台的生态适配能力,能够从传统推理链路中解耦 Prefill 任务,使其成为可独立供给与优化的算力资源池。趋境科技则依托自研的国产 PD 异构技术,完成跨设备的模型深度优化与协同调度,将异构资源整合为统一的端到端推理服务。据项目数据显示,由 4 至 5 台 MTT S5000 组成的 Prefill 资源池,在同等生产服务标准下,其输入 Token 处理性价比已超越国际先进算力方案。
技术方案的可行性最终需经受真实业务的检验。趋境科技与摩尔线程的合作方案已投入生产,并承接了头部模型厂商的官方业务流量。生产运行数据显示,在国产头部大模型的复杂业务场景中,该协同方案实现了平均超过 50 TPS 的生成速度、超 90% 的 KV Cache 命中率以及 99.9% 的稳定性,同时保障了生产级的低首 Token 时延(TTFT)。这些数据表明,国产算力已具备将硬件潜力转化为规模化、高品质 AI Token 生产能力的现实基础。
上述成果背后,是趋境科技所秉持的"少模型、深优化"技术路线。这一理念主张将核心工程资源聚焦于具有明确规模化需求的重点模型,围绕模型、芯片与推理系统进行持续迭代。其衡量标准并非单一的跑分成绩,而是在实际运行中能否兼顾时延、吞吐、稳定性与长上下文处理能力。在此次合作中,双方基于线上流量持续检验优化效果,并据此迭代模型配置与服务策略,使性能提升从实验参数转化为稳定的生产能力,并进一步沉淀至趋境科技的 ATaaS 平台,形成可复用的经验资产。
基于此次战略合作,双方的目标是共同建设能够承接真实业务、持续生产高品质 AI Token 的国产化工厂。为此,双方将推出以 Token Pod(Token 超节点)为载体的软硬一体化解决方案。摩尔线程提供 MTT S5000 与 MUSA 平台,趋境科技则将自研的 PD 异构推理系统与 ATaaS 平台深度整合进 Token Pod,形成覆盖基础设施、推理优化与持续运营的专属集群。Token Pod 的设计具备共享 KV Cache、流量感知配置与弹性扩展能力,旨在适配国产及国际主流硬件组合,以加快联合方案在各类项目中的标准化交付。
值得注意的是,这一合作模式的规模化复制已有一定的生产基础作为支撑。截至 2026 年 8 月,趋境科技已完成了日均万亿级高品质 AI Token 生产项目的共建,并在多个项目中形成了日均千亿级的生产能力,为更大规模的国产化 Token 工厂建设积累了工程经验。
从更宏观的视角看,这一合作案例揭示了国产算力发展的新趋势:竞争力正从单卡性能指标延伸至系统级的 Token 生产效率。通过国产硬件与异构技术的深度协同,趋境科技与摩尔线程为万亿参数大模型的规模化推理提供了一条兼顾性能与成本效率的可行路径。未来,双方计划拓展在互联网企业、基础模型公司及运营商等关键行业的合作,以推动国产 PD 异构推理进入更广泛的生产应用场景。
对于关注 AI 基础设施演进的从业者而言,这一案例提供了关于"如何让国产算力在商业上更具竞争力"的思考维度。关于异构推理的技术细节,可参考 趋境科技与清华大学在系统顶会上的相关研究成果 以获取更深入的学术视角;同时,摩尔线程的上市辅导动态 也反映了国产 GPU 产业化的整体进程。
趋境科技与摩尔线程的此次联手,不仅是两家公司之间的商业合作,更是国内 AI 算力生态走向协同进化的一个缩影。与海外巨头依赖单一封闭生态不同,国内产业链呈现出"芯片设计+系统软件+推理优化"多方协作的鲜明特征。这种模式有助于在硬件性能存在代际差距的现实下,通过软件定义与架构创新来弥补不足,甚至在某些特定场景下实现反超。这也为国内大模型厂商提供了除英伟达之外更具成本效益的多元化算力选择,对保障国内 AI 产业供应链安全具有长远意义。
PD 异构是将大模型推理过程中的 Prefill(预填充)和 Decode(解码)两个阶段进行分离,并部署在不同类型的算力硬件上执行的技术。Prefill 阶段计算密集,适合用高算力但成本相对较低的卡处理;Decode 阶段对内存带宽要求高,适合用高带宽 GPU 处理。这种分工能优化资源利用,降低单位 Token 的生产成本。
Token Pod(Token 超节点)是趋境科技与摩尔线程联合推出的软硬一体化解决方案的交付载体。它将摩尔线程的 MTT S5000 智算卡与趋境科技的国产 PD 异构推理系统、ATaaS 平台深度融合,形成可独立配置和扩展的专属推理集群,旨在加快国产化高品质 AI Token 生产方案的标准化落地。
其性价比优势并非来自简单的硬件低价,而是通过系统级优化实现。具体而言,通过 PD 异构技术将 Prefill 任务从高成本资源中解耦,交由摩尔线程 MTT S5000 等性价比更高的算力处理,避免按单一阶段峰值需求配置整套基础设施,从而显著降低整体生产成本。
这是趋境科技的核心技术路线,主张将工程资源聚焦于具有明确规模化需求的重点模型,围绕模型、芯片与推理系统进行深度协同优化。其目标是确保在实际运行中兼顾时延、吞吐、稳定性与成本,持续产出高品质 AI Token,而非追求宽泛的模型适配数量。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

中国气象局与中科曙光联合宣布,MCV天气-气候一体化模式依托曙光8000全国产超集群,全球首次实现5公里分辨率、10天预报1小时算完,超越欧洲中心IFS业务水平。本文从算力困局、技术突破、AI4S底座三个维度解析这一成果的深层意义。

市场监管总局约谈六大酒店预订平台防范"内卷"竞争风险,支付月付产品去向引发关注,华为问界合作模式调整,小红书发布金融生态公约,海外AI安全监管与自研芯片同步推进。

吉利银河战舰 700 开启预售,19.98 万元起,最高 1129 匹马力。其 GTA 原生新能源越野架构把大梁嵌入承载式车身,在公路舒适性与越野抗扭性之间寻找第三条路。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。