OpenAI 发布 GPT-5.4:专业工作的新一代前沿模型
AI人工智能

OpenAI 发布 GPT-5.4:专业工作的新一代前沿模型

bingdadabingdada
八月 2, 20265 次阅读约 6 分钟阅读
快速回答

OpenAI 发布 GPT-5.4,这是其用于专业工作最强大、最高效的前沿模型,在推理、编码和智能体工作流方面取得重大突破,支持原生计算机操作,上下文窗口达100万令牌。

核心要点
  • GPT-5.4 的核心突破
  • ChatGPT 中的新体验
  • API 和 Codex 中的强大功能
  • 知识工作能力的飞跃
  • 行业专家评价
目录

OpenAI 发布 GPT-5.4:专业工作的新一代前沿模型

2026年3月5日,OpenAI 正式发布 GPT-5.4,这是其迄今为止用于专业工作最强大、最高效的前沿模型。该模型已在 ChatGPT(作为 GPT-5.4 Thinking)、API 和 Codex 中上线。同时,OpenAI 还推出了 GPT-5.4 Pro 版本,面向需要在复杂任务中获得极致性能的用户。

GPT-5.4 的核心突破

GPT-5.4 将 OpenAI 近期在推理、编码和智能体工作流方面的最新进展整合到一个统一的前沿模型中。它融合了 GPT-5.3-Codex 行业领先的编码能力,同时显著改进了模型在跨工具、跨软件环境以及涉及电子表格、演示文稿和文档的专业任务中的表现。

主要改进领域

  • 推理能力:GPT-5.4 在通用推理方面取得重大进展,在 GDPval 基准测试中,83.0% 的对比中达到或超过了行业专业人士的水平,而 GPT-5.2 仅为 70.9%。
  • 编码能力:继承并优化了 GPT-5.3-Codex 的编码优势,在 SWE-Bench Pro 测试中达到 57.7% 的胜率。
  • 计算机使用:首次在通用模型中原生支持最先进的计算机操作能力,使智能体能够跨应用程序操作计算机并执行复杂工作流。
  • 工具集成:通过工具搜索功能,帮助智能体更高效地发现和使用合适的工具,同时不牺牲智能水平。
  • 令牌效率:相比 GPT-5.2,GPT-5.4 使用显著更少的令牌解决问题,带来更快的速度和更低的成本。

ChatGPT 中的新体验

在 ChatGPT 中,GPT-5.4 Thinking 现在能够提供其思考过程的前期计划,让用户可以在模型工作过程中调整方向,从而无需额外轮次就能获得更符合需求的最终输出。此外,GPT-5.4 Thinking 还改进了深度网络研究能力,特别擅长处理高度具体的查询,同时更好地维护需要更长思考时间的问题上下文。

API 和 Codex 中的强大功能

对于开发者而言,GPT-5.4 在 API 和 Codex 中提供了多项关键改进:

  • 原生计算机使用能力:支持智能体通过 Playwright 等库编写代码操作计算机,以及直接发出鼠标和键盘指令。
  • 超长上下文支持:最多支持 100 万个令牌的上下文,使智能体能够规划、执行和验证跨长时间跨度的任务。
  • 工具生态系统:改进了模型在大型工具和连接器生态系统中的工作方式,通过工具搜索帮助智能体更高效地找到和使用合适的工具。

知识工作能力的飞跃

GPT-5.4 在知识工作方面的提升尤为显著。在模拟初级投资银行分析师工作的电子表格建模任务内部基准测试中,GPT-5.4 的平均得分达到 87.3%,而 GPT-5.2 仅为 68.4%。

在演示文稿评估方面,人类评审员在 68.0% 的情况下更偏好 GPT-5.4 生成的演示文稿,原因在于其更强的美学设计、更大的视觉多样性以及更有效地使用图像生成功能。

减少幻觉和错误

GPT-5.4 是 OpenAI 迄今为止最注重事实准确性的模型。在用户标记事实错误的去标识化提示集合中,与 GPT-5.2 相比:

  • 单个声明的错误可能性降低 33%
  • 完整响应包含任何错误的可能性降低 18%

行业专家评价

Mercor 首席执行官 Brendan Foody 表示:“GPT-5.4 是我们尝试过的最好的模型。它在我们的 APEX-Agents 基准测试中位居榜首,该基准测试衡量模型在专业服务工作中的表现。它擅长创建长期交付物,如幻灯片、财务模型和法律分析,在提供顶级性能的同时,运行速度更快,成本低于竞争性前沿模型。”

Harvey 应用研究主管 Niko Grupen 补充道:“GPT-5.4 为文档密集型法律工作设立了新标准。在我们的 BigLaw Bench 评估中,它获得了 91% 的分数。与其他模型相比,GPT-5.4 目前更擅长构建复杂的交易分析,在长合同上保持准确性,并提供法律从业者所需的高水平细节。”

性能基准测试结果

基准测试 GPT-5.4 GPT-5.3-Codex GPT-5.2
GDPval (胜率或平局) 83.0% 70.9% 70.9%
SWE-Bench Pro (公开) 57.7% 56.8% 55.6%
OSWorld-Verified 75.0% 74.0%* 47.3%
Toolathlon 54.6% 51.9% 46.3%
BrowseComp 82.7% 77.3% 65.8%*

*注:GPT-5.3-Codex 使用新引入的 API 参数保持原始图像分辨率后达到 74.0%。GPT-5.2 的 BrowseComp 分数此前报告为 64.7%。

可用性和部署

GPT-5.4 现已通过以下渠道提供:

  • ChatGPT:作为 GPT-5.4 Thinking 和 GPT-5.4 Pro 使用
  • API:面向开发者的完整模型访问
  • Codex:集成开发环境中的原生支持
  • Excel 插件:新发布的 ChatGPT for Excel 插件,特别推荐给企业客户

OpenAI 还更新了 Codex 和 API 中的电子表格和演示文稿技能,以充分利用 GPT-5.4 的能力。

未来展望

GPT-5.4 的发布标志着 AI 在专业工作领域的一个重要里程碑。通过将推理、编码、计算机使用和工具集成统一到一个模型中,OpenAI 为更可靠的智能体、更快的开发者工作流以及更高质量的跨平台输出奠定了基础。随着企业用户开始探索 GPT-5.4 的能力,我们可以期待看到 AI 在专业工作流程中的更深入整合,以及更多创新应用的出现。

黄金广告位 · 限时招商
广告位招商中

把品牌放进读者的阅读流

文章内广告位,高注意力场景,适合新品发布与活动招募。

bingdada

bingdada

SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

相关文章

订阅我们的 Newsletter

获取最新的 SEO 与 GEO 技术资讯。

我们尊重您的隐私,随时可以取消订阅。

评论 ({count}) (0)

登录后即可参与讨论

还没有评论,来抢沙发吧