
OpenAI 发布 GPT-5.4 mini 和 nano,这是其迄今为止最强大的小型模型。新模型在编码、推理、多模态理解等方面显著提升,运行速度快 2 倍以上,接近 GPT-5.4 的性能,同时大幅降低成本。适用于编码助手、子代理系统和计算机使用等场景。
2026年3月17日,OpenAI 正式发布了 GPT-5.4 mini 和 GPT-5.4 nano,这是其迄今为止最强大的小型模型。这两款新模型将 GPT-5.4 的诸多优势浓缩到了更快、更高效的架构中,专为高吞吐量工作负载设计。此次发布标志着 OpenAI 在模型效率与性能平衡上迈出了关键一步,尤其为需要低延迟和高可靠性的应用场景提供了全新选择。
GPT-5.4 mini 在编码、推理、多模态理解和工具使用等多个维度上,相比前代 GPT-5 mini 实现了显著提升,同时运行速度快了 2 倍以上。在包括 SWE-Bench Pro 和 OSWorld-Verified 在内的多项评估中,它甚至接近了更大规模的 GPT-5.4 模型的性能水平。
对于开发者而言,这意味着可以在不牺牲太多性能的前提下,大幅降低推理成本和响应时间。尤其是在编码助手、实时多模态应用和计算机使用系统中,GPT-5.4 mini 的低延迟特性能够直接提升用户体验。
GPT-5.4 nano 是 GPT-5.4 系列中最小、最便宜的版本,专为速度和成本至关重要的场景设计。它是 GPT-5 nano 的一次重大升级,特别适用于分类、数据提取、排序以及处理简单支持任务的编码子代理(subagents)。
对于需要大规模部署 AI 能力的企业来说,GPT-5.4 nano 提供了一个极具性价比的选择。它能够在保持合理性能的同时,将成本控制在最低水平,非常适合处理那些对延迟敏感但推理复杂度较低的任务。
为了直观展示 GPT-5.4 mini 和 nano 的实力,以下是与 GPT-5.4 和 GPT-5 mini 在多个基准测试中的对比数据:
| 基准测试 | GPT-5.4 (xhigh) | GPT-5.4 mini (xhigh) | GPT-5.4 nano (xhigh) | GPT-5 mini (high¹) |
|---|---|---|---|---|
| SWE-Bench Pro (Public) | 57.7% | 54.4% | 52.4% | 45.7% |
| Terminal-Bench 2.0 | 75.1% | 60.0% | 46.3% | 38.2% |
| Toolathlon | 54.6% | 42.9% | 35.5% | 26.9% |
| GPQA Diamond | 93.0% | 88.0% | 82.8% | 81.6% |
| OSWorld-Verified | 75.0% | 72.1% | 39.0% | 42.0% |
注:GPT-5 mini 的最高推理努力等级为 'high'。
从数据可以看出,GPT-5.4 mini 在多项测试中不仅大幅超越了 GPT-5 mini,甚至在 SWE-Bench Pro 和 OSWorld-Verified 等关键任务上,其性能已经非常接近旗舰级的 GPT-5.4。而 GPT-5.4 nano 虽然在复杂推理任务上有所取舍,但在成本和速度上具有无可比拟的优势。
Hebbia 的 CTO Aabhas Sharma 在测试后表示:“GPT-5.4 mini 在同级别模型中提供了强大的端到端性能。在我们的评估中,它在多个输出任务和引文召回方面,以低得多的成本匹配或超越了竞品模型。此外,它的端到端通过率和来源归因能力甚至超过了更大的 GPT-5.4 模型。”
这种来自行业领先企业的认可,进一步印证了 GPT-5.4 mini 在真实业务场景中的价值。
GPT-5.4 mini 和 nano 在编码工作流中表现尤为出色。它们能够以低延迟处理定向编辑、代码库导航、前端生成和调试循环等任务,非常适合需要快速迭代的编码场景。
在基准测试中,GPT-5.4 mini 在相似延迟下持续优于 GPT-5 mini,其通过率接近 GPT-5.4 水平,同时运行速度更快。这使其成为编码工作流中性能与延迟平衡的最佳选择之一。
GPT-5.4 mini 也非常适合构建由不同规模模型组成的混合系统。以 OpenAI 的 Codex 为例,大型模型如 GPT-5.4 可以负责规划、协调和最终判断,而 GPT-5.4 mini 作为子代理并行处理更狭窄的子任务,如搜索代码库、审查大文件或处理支持文档。
这种模式随着小型模型变得更快、更强大而变得越来越有用。开发者不再需要用一个模型处理所有事情,而是可以构建一个系统,让大模型决定做什么,小模型快速大规模执行。GPT-5.4 mini 是目前最适合这种工作流的 mini 模型。
GPT-5.4 mini 在多模态任务,特别是与计算机使用相关的任务上表现强劲。该模型可以快速解释密集用户界面的截图,以极快的速度完成计算机使用任务。在 OSWorld-Verified 基准测试中,GPT-5.4 mini 的性能接近 GPT-5.4,同时大幅超越 GPT-5 mini。
GPT-5.4 mini 即日起可通过 API、Codex 和 ChatGPT 使用。
GPT-5.4 nano 仅通过 API 提供,输入 token 价格为每百万 0.20 美元,输出 token 价格为每百万 1.25 美元。
为了更全面地展示 GPT-5.4 mini 和 nano 的能力,以下是更详细的基准测试数据:
编码能力
| 基准测试 | GPT-5.4 (xhigh) | GPT-5.4 mini (xhigh) | GPT-5.4 nano (xhigh) | GPT-5 mini (high¹) |
|---|---|---|---|---|
| SWE-bench Pro (Public) | 57.7% | 54.4% | 52.4% | 45.7% |
| Terminal-Bench 2.0 | 75.1% | 60.0% | 46.3% | 38.2% |
工具调用能力
| 基准测试 | GPT-5.4 (xhigh) | GPT-5.4 mini (xhigh) | GPT-5.4 nano (xhigh) | GPT-5 mini (high¹) |
|---|---|---|---|---|
| MCP Atlas | 67.2% | 57.7% | 56.1% | 47.6% |
| Toolathlon | 54.6% | 42.9% | 35.5% | 26.9% |
| τ2-bench (telecom) | 98.9% | 93.4% | 92.5% | 74.1% |
智能推理能力
| 基准测试 | GPT-5.4 (xhigh) | GPT-5.4 mini (xhigh) | GPT-5.4 nano (xhigh) | GPT-5 mini (high¹) |
|---|---|---|---|---|
| GPQA Diamond | 93.0% | 88.0% | 82.8% | 81.6% |
| HLE w/ tool | 52.1% | 41.5% | 37.7% | 31.6% |
| HLE w/o tools | 39.8% | 28.2% | 24.3% | 18.3% |
多模态/视觉/计算机使用能力
| 基准测试 | GPT-5.4 (xhigh) | GPT-5.4 mini (xhigh) | GPT-5.4 nano (xhigh) | GPT-5 mini (high¹) |
|---|---|---|---|---|
| OSWorld-Verified | 75.0% | 72.1% | 39.0% | 42.0% |
| MMMUPro w/ Python | 81.5% | 78.0% | 69.5% | 74.1% |
GPT-5.4 mini 和 nano 的发布,代表了 OpenAI 在模型小型化和高效化方面的最新成果。它们不仅继承了 GPT-5.4 的核心优势,更在速度、成本和实用性上做出了重要突破。对于开发者、企业和 AI 爱好者来说,这意味着可以在更多场景中部署强大的 AI 能力,同时更好地控制成本和响应时间。
有关模型安全保障的更多信息,请查阅 OpenAI 部署安全中心的系统卡附录。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

OpenAI销售团队规模一年增长三倍,通过构建GTM Assistant智能助手,将顶尖销售经验系统化,实现销售生产力提升20%,让销售代表每周多出一天时间专注于客户关系。

OpenAI 正式发布 AI 视频生成模型 Sora,通过水印溯源、肖像权控制、青少年保护、内容过滤等多维安全策略,在推动视频创作创新的同时,构建了负责任的 AI 应用框架。

OpenAI 发布 Sora 2,视频生成模型迎来 GPT-3.5 时刻。新模型在物理准确性、可控性上大幅提升,支持同步音效和对话,并推出基于‘角色’功能的社交 iOS 应用。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。