Bingdada 기술 블로그Bingdada 기술 블로그
홈블로그SEOGEOAEOAI도구소개
로그인회원가입
Logo

Bingdada 기술 블로그

SEO, GEO 및 미래 AI 트렌드에 초점을 맞춘 기술 블로그.

빠른 링크

  • 홈
  • 블로그 글
  • 소개

연락처

  • 398848662@qq.com

최신 SEO·GEO 정보를 받아볼래 뉴스레터를 구독하세요.

© 2024 Bingdada 技术博客. All rights reserved.

이 글은 간체 중국어입니다. 한국어(으)로 번역하려면 클릭하세요.
홈블로그AI人工智能OpenAI 发布 GPT-5.4:专业工作的新一代前沿模型
OpenAI 发布 GPT-5.4:专业工作的新一代前沿模型
AI人工智能

OpenAI 发布 GPT-5.4:专业工作的新一代前沿模型

bingdadabingdada
8월 2, 2026132회 읽음약 6분 분량
post.quickAnswer

OpenAI 发布 GPT-5.4,这是其用于专业工作最强大、最高效的前沿模型,在推理、编码和智能体工作流方面取得重大突破,支持原生计算机操作,上下文窗口达100万令牌。

post.keyTakeaways
  • GPT-5.4 的核心突破
  • ChatGPT 中的新体验
  • API 和 Codex 中的强大功能
  • 知识工作能力的飞跃
  • 行业专家评价
목차

목차

  • GPT-5.4 的核心突破
  • 主要改进领域
  • ChatGPT 中的新体验
  • API 和
  • 知识工作能力的飞跃
  • 减少幻觉和错误
  • 行业专家评价
  • 性能基准测试结果
  • 可用性和部署
  • 未来展望
  • 相关阅读
  • 关于 Bingdada

2026年3月5日,OpenAI 正式发布 GPT-5.4,这是其迄今为止用于专业工作最强大、最高效的前沿模型。该模型已在 ChatGPT(作为 GPT-5.4 Thinking)、API 和 Codex 中上线。同时,OpenAI 还推出了 GPT-5.4 Pro 版本,面向需要在复杂任务中获得极致性能的用户。

GPT-5.4 的核心突破

GPT-5.4 将 OpenAI 近期在推理、编码和智能体工作流方面的最新进展整合到一个统一的前沿模型中。它融合了 GPT-5.3-Codex 行业领先的编码能力,同时显著改进了模型在跨工具、跨软件环境以及涉及电子表格、演示文稿和文档的专业任务中的表现。

主要改进领域

  • 推理能力:GPT-5.4 在通用推理方面取得重大进展,在 GDPval 基准测试中,83.0% 的对比中达到或超过了行业专业人士的水平,而 GPT-5.2 仅为 70.9%。

  • 编码能力:继承并优化了 GPT-5.3-Codex 的编码优势,在 SWE-Bench Pro 测试中达到 57.7% 的胜率。

  • 计算机使用:首次在通用模型中原生支持最先进的计算机操作能力,使智能体能够跨应用程序操作计算机并执行复杂工作流。

  • 工具集成:通过工具搜索功能,帮助智能体更高效地发现和使用合适的工具,同时不牺牲智能水平。

  • 令牌效率:相比 GPT-5.2,GPT-5.4 使用显著更少的令牌解决问题,带来更快的速度和更低的成本。

ChatGPT 中的新体验

在 ChatGPT 中,GPT-5.4 Thinking 现在能够提供其思考过程的前期计划,让用户可以在模型工作过程中调整方向,从而无需额外轮次就能获得更符合需求的最终输出。此外,GPT-5.4 Thinking 还改进了深度网络研究能力,特别擅长处理高度具体的查询,同时更好地维护需要更长思考时间的问题上下文。

API 和

Codex 中的强大功能 对于开发者而言,GPT-5.4 在 API 和 Codex 中提供了多项关键改进:

  • 原生计算机使用能力:支持智能体通过 Playwright 等库编写代码操作计算机,以及直接发出鼠标和键盘指令。

  • 超长上下文支持:最多支持 100 万个令牌的上下文,使智能体能够规划、执行和验证跨长时间跨度的任务。

  • 工具生态系统:改进了模型在大型工具和连接器生态系统中的工作方式,通过工具搜索帮助智能体更高效地找到和使用合适的工具。

知识工作能力的飞跃

GPT-5.4 在知识工作方面的提升尤为显著。在模拟初级投资银行分析师工作的电子表格建模任务内部基准测试中,GPT-5.4 的平均得分达到 87.3%,而 GPT-5.2 仅为 68.4%。 在演示文稿评估方面,人类评审员在 68.0% 的情况下更偏好 GPT-5.4 生成的演示文稿,原因在于其更强的美学设计、更大的视觉多样性以及更有效地使用图像生成功能。

减少幻觉和错误

GPT-5.4 是 OpenAI 迄今为止最注重事实准确性的模型。在用户标记事实错误的去标识化提示集合中,与 GPT-5.2 相比: - 单个声明的错误可能性降低 33%

  • 完整响应包含任何错误的可能性降低 18%

行业专家评价

Mercor 首席执行官 Brendan Foody 表示:“GPT-5.4 是我们尝试过的最好的模型。它在我们的 APEX-Agents 基准测试中位居榜首,该基准测试衡量模型在专业服务工作中的表现。它擅长创建长期交付物,如幻灯片、财务模型和法律分析,在提供顶级性能的同时,运行速度更快,成本低于竞争性前沿模型。” Harvey 应用研究主管 Niko Grupen 补充道:“GPT-5.4 为文档密集型法律工作设立了新标准。在我们的 BigLaw Bench 评估中,它获得了 91% 的分数。与其他模型相比,GPT-5.4 目前更擅长构建复杂的交易分析,在长合同上保持准确性,并提供法律从业者所需的高水平细节。”

性能基准测试结果

| 基准测试 | GPT-5.4 | GPT-5.3-Codex | GPT-5.2 |

|---------|---------|--------------|---------| | GDPval (胜率或平局) | 83.0% | 70.9% | 70.9% | | SWE-Bench Pro (公开) | 57.7% | 56.8% | 55.6% | | OSWorld-Verified | 75.0% | 74.0%* | 47.3% | | Toolathlon | 54.6% | 51.9% | 46.3% | | BrowseComp | 82.7% | 77.3% | 65.8%* | *注:GPT-5.3-Codex 使用新引入的 API 参数保持原始图像分辨率后达到 74.0%。GPT-5.2 的 BrowseComp 分数此前报告为 64.7%。

可用性和部署

GPT-5.4 现已通过以下渠道提供:

  • ChatGPT:作为 GPT-5.4 Thinking 和 GPT-5.4 Pro 使用

  • API:面向开发者的完整模型访问

  • Codex:集成开发环境中的原生支持

  • Excel 插件:新发布的 ChatGPT for Excel 插件,特别推荐给企业客户 OpenAI 还更新了 Codex 和 API 中的电子表格和演示文稿技能,以充分利用 GPT-5.4 的能力。

未来展望

GPT-5.4 的发布标志着 AI 在专业工作领域的一个重要里程碑。通过将推理、编码、计算机使用和工具集成统一到一个模型中,OpenAI 为更可靠的智能体、更快的开发者工作流以及更高质量的跨平台输出奠定了基础。随着企业用户开始探索 GPT-5.4 的能力,我们可以期待看到 AI 在专业工作流程中的更深入整合,以及更多创新应用的出现。


相关阅读

  • OpenAI 网络安全行动:揭露并封禁疑似与 PRC 情报需求相关的网络钓鱼与脚本攻击账户

  • 思科与OpenAI联手Codex,重新定义企业级工程开发

  • OpenAI 被 Gartner 评为企业编码代理领导者

关于 Bingdada

Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。 编辑团队:内容策划 · 技术编辑 · AI 研究组 网站:bingdada.com © 2026 Bingdada. 保留所有权利。

목차

  • GPT-5.4 的核心突破
  • 主要改进领域
  • ChatGPT 中的新体验
  • API 和
  • 知识工作能力的飞跃
  • 减少幻觉和错误
  • 行业专家评价
  • 性能基准测试结果
  • 可用性和部署
  • 未来展望
  • 相关阅读
  • 关于 Bingdada
프리미엄 광고 영역 · 한정 기간
광고 문의

브랜드를 독자의 피드에 올리세요

본문 내 광고 영역은 높은 주목도를 가진 순간으로, 신제품 출시와 이벤트 모집에 적합합니다.

비즈니스 문의

태그

#OpenAI News#GPT-5.4#智能体工作流#专业工作模型#AI推理能力#计算机使用
bingdada

bingdada

SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

관련 글

当IPO遇上AI代理:律所如何把上市准备从数月压缩到数周
AI人工智能

当IPO遇上AI代理:律所如何把上市准备从数月压缩到数周

国际律所 Cooley 基于 ChatGPT Work 打造 GO Public,用代理编排层重构 IPO 准备流程:AI 负责信息梳理,律师专注判断与决策。本文解析其运作逻辑,并对比国内法律 AI 的落地路径。

9월 18약 5분 분량
银发族也能玩转AI:OpenAI联手OATS把ChatGPT课堂开进美国十城
AI人工智能

银发族也能玩转AI:OpenAI联手OATS把ChatGPT课堂开进美国十城

OpenAI 与 AARP 旗下 OATS 合作,在美国10座城市为老年人开设免费 ChatGPT 线下工作坊,课程兼顾日常应用与防诈骗教育,为AI普惠提供了可复制的社区样本。

9월 17약 6분 분량
OpenAI 让全员用自然语言查数据,企业分析的门槛正在消失
AI人工智能

OpenAI 让全员用自然语言查数据,企业分析的门槛正在消失

OpenAI 在 ChatGPT Work 中推出 Data agent,让员工用自然语言连接企业数据、生成看板并直接行动。本文解析其数据源、语义层与权限设计,并对比国内同类进展。

9월 16약 5분 분량

뉴스레터 구독

최신 SEO·GEO 정보를 받아보세요.

개인정보를 존중합니다. 언제든 구독을 취소할 수 있습니다.

댓글 ({count}) (0)

로그인하여 토론에 참여하세요

로그인가입
아직 댓글이 없습니다. 첫 댓글을 작성해 주세요