
GDPval 是 OpenAI 推出的新评估框架,通过覆盖 44 个职业的 1,320 项真实工作任务,衡量 AI 模型在经济价值高的现实场景中的表现。它旨在弥补传统学术基准的不足,为 AI 对生产力的实际影响提供证据基础。
这些测试在推动模型推理能力的边界方面功不可没,但它们往往无法反映许多人在日常工作中处理的任务类型。为了弥补这一差距,OpenAI 推出了 GDPval——一个全新的评估框架,旨在衡量模型在经济价值高、贴近现实世界的任务上的表现。该评估覆盖了 44 个职业,所有任务均源自真实的工作产出。
GDPval? GDPval 的命名源于其设计理念:以国内生产总值(GDP)这一关键经济指标为出发点,从对 GDP 贡献最大的行业中的关键职业提取任务。OpenAI 的使命是确保通用人工智能惠及全人类,而 GDPval 正是为了透明地传达 AI 模型在现实世界中帮助人们的能力。 该评估的首个版本涵盖了从对美国 GDP 贡献最大的 9 大行业中选出的 44 个职业。GDPval 完整集包含 1,320 项专业任务(其中 220 项为开源黄金集),每项任务都由平均从业经验超过 14 年的资深专业人士精心设计和审核。任务基于真实的工作产品,例如法律简报、工程蓝图、客户支持对话或护理计划。
与 SWE-Lancer(基于真实薪酬的自由软件工程项目)等专注于特定领域的评估不同,GDPval 涵盖了众多任务和职业,具有高度的多样性和现实性。与学术考试风格的基准(如 Humanity's Last Exam)不同,GDPval 的任务并非简单的文本提示,而是附带参考文件和上下文,预期交付物涵盖文档、幻灯片、图表、电子表格和多媒体等多种形式。 历史表明,从互联网到智能手机,重大技术从发明到广泛采用需要十多年的时间。像 GDPval 这样的评估有助于将关于 AI 未来改进的讨论建立在证据而非猜测的基础上。然而,OpenAI 也承认,GDPval 是一个早期步骤,尚未反映许多经济任务的全部细微差别。它目前仅限于单次评估,无法捕捉模型需要构建上下文或通过多轮草稿改进的情况。
GDPval 的行业选择基于圣路易斯联邦储备银行的数据,选取了对美国 GDP 贡献超过 5% 的行业。随后,研究团队利用美国劳工统计局(BLS)2024 年 5 月的职业就业报告中的工资和就业数据,在每个行业内挑选出对总工资和薪酬贡献最大的 5 个职业。 为了确定职业是否主要为知识工作,团队使用了美国劳工部赞助的 O*NET 数据库中的任务数据。他们将每个职业的每项任务分类为知识工作或体力劳动,如果一个职业中至少 60% 的任务被归类为不涉及体力劳动,则该职业被认定为“主要知识工作”。这一阈值作为第一版 GDPval 的起点,重点关注 AI 可能对现实生产力产生最高影响的职业。
AI 模型的评估与进展 OpenAI 的 GDPval 发布为全球 AI 评估领域设立了新的标杆。在国内,类似的评估体系也在快速发展。例如,百度的文心一言、阿里巴巴的通义千问、深度求索的 DeepSeek 以及智谱的 GLM 等模型,在中文语境下的专业任务评估中各有侧重。国内的评估往往更注重中文语义理解、传统文化知识以及特定行业(如金融、制造)的落地应用。 与国际上强调 GDP 关联的评估不同,国内厂商在模型评估上更倾向于结合具体的产业场景,如电商客服、智能办公助手等。随着 GDPval 这类评估的引入,国内 AI 社区也开始思考如何借鉴其方法论,构建更贴近真实经济价值的评测体系,以推动模型在生产力工具中的实际应用。
GDPval 是 AI 评估领域的一次重要进步,它不再局限于学术竞赛,而是直接面向经济生产。未来版本将扩展到更具交互性的工作流程和上下文丰富的任务,以更好地反映现实世界知识工作的复杂性。 业界普遍认为,AI 对经济的影响将是深远且长期的。通过 GDPval,OpenAI 试图为衡量这种影响提供一个更坚实的证据基础。正如 OpenAI 在官方博客中所说:“评估像 GDPval 这样的工具,有助于将关于未来 AI 改进的对话建立在证据而非猜测之上。”
GDPval 专注于基于真实工作产品的任务,覆盖 44 个职业,强调经济价值;而 MMLU 是学术考试式问答,SWE-Bench 仅关注软件工程缺陷修复。GDPval 的任务更贴近现实,且附带有参考文件和上下文。
行业基于圣路易斯联邦储备银行数据,选取对美国 GDP 贡献超过 5% 的行业;职业则根据美国劳工统计局工资数据,选择每个行业中薪酬贡献最大的知识工作职业,并通过 O*NET 任务数据验证其知识工作属性。
GDPval 目前仅支持单次评估,无法捕捉多轮迭代或上下文积累的工作场景。此外,它主要覆盖美国经济结构中的职业,未来需要扩展到更多国家和行业以增强全球适用性。
模型如何借鉴 GDPval 的思路? 国内厂商可以借鉴 GDPval 的方法论,结合本土产业特点(如制造业升级、数字政务),构建基于真实工作场景的评估集,以衡量模型在具体经济任务中的生产力提升效果。
GDPval 帮助用户了解 AI 模型在处理日常专业任务(如撰写法律文件、制定护理计划)中的实际能力,从而更合理地选择和使用 AI 工具来提升工作效率。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。 编辑团队:内容策划 · 技术编辑 · AI 研究组 网站:bingdada.com © 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

英伟达内部实践显示,ChatGPT Work正帮助企业团队将信息整合工作自动化,每周节省16小时,并将原型开发周期从数周缩短至数天。这一案例揭示了AI工作流从工具到组织资产演进的趋势。

OpenAI 将 GPT-5.6 系列模型(Sol、Terra、Luna)集成至 Kiro 开发代理,通过规格驱动方法实现约 82% 的成本降低,标志着 AI 编程从能力竞赛转向成本效率竞争。

OpenAI因模型网络能力逼近关键门槛而调整开发策略,强调安全需贯穿训练全周期。文章解析其技术升级,并对比国内AI安全建设路径。
최신 SEO·GEO 정보를 받아보세요.
개인정보를 존중합니다. 언제든 구독을 취소할 수 있습니다.