
阶跃星辰 Step 5 Preview 是一款 600B 总参数、27B 激活参数的 MoE 旗舰模型,在 Artificial Analysis 榜单中位列开源第三,单任务成本约 0.71 美元,仅为 Claude Opus 5(max)的八分之一,定价对标 DeepSeek-V4-Pro 高峰时段,计划 10 月 15 日开源。
在大模型参数规模持续膨胀的当下,一个反直觉的趋势正在浮现:总参数量不再是衡量推理成本的直接指标。阶跃星辰近期推向市场的 Step 5 Preview 提供了一个值得拆解的样本——600B 总参数、27B 激活参数、100 万 Token 上下文窗口,并原生接受文本与视觉两类输入。这套配置的核心逻辑并非追求参数榜单上的数字优势,而是把每次推理实际调用的计算量压到总盘子的二十分之一以下。
从工程视角看,MoE(混合专家)架构的稀疏激活本质上是一种「按需付费」的计算分配机制。Step 5 Preview 将这一机制与百万级上下文结合,意味着长文档、多轮工具调用、跨模态素材可以同时进入同一个推理会话,而不必因窗口截断而反复重建上下文。对于需要连续执行数十步操作的 Agent 任务而言,这种连续性直接决定了任务能否收敛。
在 Artificial Analysis Intelligence Index 的评估中,Step 5 Preview 录得 44 分,位列开源模型第三梯队,排在 Qwen3.8 Max(0902)与 GLM-5.3(max)之后。输出速度方面,该榜单记录为 100 token/秒,排名第六。这两个数字放在一起看,说明模型在质量与吞吐之间选择了一条中间路线,而非单点极致。
阶跃官方披露的基准测试则覆盖了另一组场景:Agent 长周期 CLI 任务、金融投资研究评测 FrontierFinance、跨领域深度研究评测 DRACO。在这些测试中,Step 5 Preview 的表现优于 Kimi K3 与 GLM-5.3,但面对 GPT-6 Astra 或 Claude Opus 5 时仍存在差距。这种「开源阵营内领先、闭源前沿仍有距离」的定位,与当前国产模型整体所处的竞争生态基本吻合。
关于 混合专家模型 的技术原理,可参考公开资料进一步了解其路由与门控机制。
成本是 Step 5 Preview 最值得关注的维度。据 Artificial Analysis 统计,该模型单次任务总开销为 0.71 美元,约合人民币 4.76 元;作为对比,Claude Opus 5(max)的单次开销为 5.86 美元,约合人民币 39.25 元。阶跃官方给出的口径是单任务成本约为后者的八分之一。
定价表进一步揭示了这一成本优势的每百万 token 输入价格(缓存未命中)7 元、缓存命中 0.35 元、输出价格 20 元。这组数字与 DeepSeek-V4-Pro-0813 高峰时段的定价形成直接对标。缓存命中与未命中之间 20 倍的价差,实际上是在引导开发者优化提示词复用策略——对于 Agent 场景中反复调用的系统指令与工具定义,缓存机制能显著摊薄单位成本。
从国内视角观察,这一价格带正在成为国产旗舰模型的密集交锋区。DeepSeek 以极致性价比著称,通义千问与文心一言在各自生态内提供阶梯定价,智谱 GLM 系列则强调开源与商用并行的双轨策略。Step 5 Preview 选择在开源前夕公布对标 DeepSeek 高峰价位的定价,本质上是把竞争焦点从「谁更便宜」转向「同等成本下谁能完成更复杂的任务」。
围绕 Step 5 Preview 的公开体验集中在四个方向,恰好覆盖了 Agent 能力的几个关键切面。
长文档到演示文稿的转换。 将一篇技术博客链接输入模型,要求生成面向非技术读者的 PPT。输出结果在内容取舍与重点标注上表现稳定,每页底部还附带了演讲提示。局限在于视觉表达仍以文字排版为主,缺少图表与配图的多元组合,需要人工追加指令才能突破单一风格。
抽象提示词的拆解与视觉落地。 面对一段高度意象化的描述,模型先自行扩写需求,再生成对应视觉网页。初版背景较为克制,仅在鼠标划过处产生光晕;经追加「增强设计感」的要求后,重新生成的页面实现了文字滚动与背景色调、元素联动的效果。这说明模型具备多轮迭代意识,但首轮输出与最终理想效果之间仍依赖用户介入。
Three.js 交互场景的一次性构建。 在卡帕多奇亚热气球交互网页的开发任务中,模型一次性产出了包含风向调节、日照时间、热气球数量控制的功能界面,并可实时预览效果。这类任务对代码生成与空间逻辑的协同要求较高,一次通过率是衡量模型工程能力的重要信号。
七轮模拟经营与决策记忆。 最具代表性的案例是让模型扮演创业模拟 Agent,经营一家新式茶饮店。模型将流程拆解为商业模式与选址、证照办理、产品定价、供应链备货、装修采购、开业引爆、终局报告七个阶段。每一轮提供多个方案及决策要点,并在用户给出「运营经验少、希望自主投入最少」的约束后,将这一偏好贯穿后续多轮建议。最终模拟结果为月净利 2.5 万元、账户留存现金 18.6 万元、排队等候学生客群 1450 人,并能将全部决策链路生成为可交互复盘产品。
这一案例的价值不在于经营数字本身,而在于验证了模型在长周期任务中对用户偏好的记忆与迁移能力——这正是 Agent 从「单次问答」走向「持续协作」的关键门槛。
Step 5 Preview 目前已全量开放,计划于 10 月 15 日正式开源。开发者可通过国内开放平台(platform.stepfun.com)或海外平台(platform.stepfun.ai)接入 API,也可在 Studio 平台(studio.stepfun.com)直接在线体验。
开源节点的选择值得注意:在模型能力已被第三方榜单验证、定价策略已明确对标竞品之后再做开源,实际上是把开源作为生态扩张的杠杆,而非单纯的技术展示。对于国内 AI 应用开发者而言,这意味着在 DeepSeek、Qwen、GLM 之外又多了一个可自部署的旗舰选项。
关于 阶跃星辰 的更多模型信息,可查阅其官方平台。
总参数量为 600B,激活参数为 27B,采用 MoE 稀疏激活架构,支持 100 万 Token 上下文窗口,原生支持文本与视觉输入。
在 Artificial Analysis Intelligence Index 中得分 44 分,位居开源模型第三,排在 Qwen3.8 Max(0902)和 GLM-5.3(max)之后;输出速度 100 token/秒,排名第六。
每百万 token 输入价格(缓存未命中)7 元、缓存命中 0.35 元、输出价格 20 元,对标 DeepSeek-V4-Pro-0813 高峰时段定价。单次任务开销约 0.71 美元,约为 Claude Opus 5(max)的八分之一。
目前已全量开放 API 接入,计划于 10 月 15 日正式开源。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
Put your brand in the reader feed
In-article ad slots: high-attention moments perfect for product launches and event recruitment.
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

2026岳麓大会透露关键信号:百亿未来产业基金落地湘江新区,68家企业156件展品展示AI从数据标注到人形机器人的完整链条。中部城市正用制造业场景反哺智能体落地,走出一条区别于沿海的差异化路线。

海信发布U7T Pro与E7S Pro+两款RGB-Mini LED旗舰电视,提出红光来源、光色同控、控色精度三个评判维度,尝试为混乱的RGB-Mini LED市场建立可操作的选购标准。

昇腾生态拐点的判断依据不只是硬件指标,更在于从超节点互联、思程抽象到低比特数据格式的一整套开发范式调整。本文拆解 Agentic 计算五条演进线索,并对照国内同类玩家的路线差异。
Get the latest SEO & GEO insights.
We respect your privacy. You can unsubscribe at any time.