
OpenAI在First Proof数学挑战中提交了10个证明尝试,其中至少5个被专家评估为高概率正确。这一成果展示了AI在科研级推理上的突破,包括长链推理、抽象选择和专家验证能力,为未来公开模型奠定了基础。
2026年2月20日,OpenAI发布了其在“First Proof”数学挑战中的初步成果。这一挑战由顶尖数学专家设计,旨在测试AI系统能否生成可验证的、针对特定领域问题的完整证明。与传统的选择题或竞赛数学不同,First Proof要求AI构建端到端的逻辑论证,且正确性需经专家严格审查。此次提交标志着AI在科研级推理能力上的重要进展,也是OpenAI News中备受关注的焦点事件。
OpenAI在2026年2月14日(太平洋时间)提交了所有10个First Proof问题的证明尝试。基于专家反馈,团队认为至少五个证明尝试(问题4、5、6、9、10)有很高概率正确,其余仍在审查中。值得注意的是,问题2的初步判断已被修正:根据官方评论和社区分析,该尝试被认定为不正确。OpenAI对社区的参与表示感谢,并期待持续审查。
所有证明尝试已公开,包含十个问题的完整论证以及新增的附录,其中总结了提示模式和交互示例,旨在模拟人工与模型协作的过程。
OpenAI认为,前沿研究是评估下一代AI能力的最重要方式。传统基准测试可能遗漏科研中最困难的部分:维持长链推理、选择正确的抽象、处理问题陈述中的歧义,以及生成经得起专家推敲的论证。First Proof这类挑战在正确性难以验证、失败模式具有信息价值的场景中,提供了压力测试。
OpenAI研究员James R. Lee(推理方向)表示:“我们正在训练一个新模型,其核心目标是提升推理的严谨性,使其能连续思考数小时并保持高置信度。First Proof发布时,我们觉得这是完美的测试平台。周末尝试后,模型已解决两个问题(#9和#10)。随着训练推进,它能力持续增强,最终至少解决了三个以上。看到模型一天天变得更聪明,令人难以置信。”
在提交过程中,OpenAI采用了有限的人工监督。在训练过程中,当提示模型时,团队有时会建议重试在早期尝试中证明有效的策略。对于某些问题,在收到专家反馈后,团队要求模型扩展或澄清证明的某些部分,以便更容易验证推理。此外,团队还促进了该模型与ChatGPT之间的交互,用于验证、格式化和风格调整。对于部分问题,团队通过人工判断选择了若干尝试中最佳的一个。
OpenAI承认,这是一次快速冲刺,过程并非如理想控制实验般完美。团队期待与First Proof组织者就未来迭代中更严格的实验和评估框架进行讨论。
这项工作建立在先前推理模型在数学和科学领域成果的基础上。2025年7月,OpenAI的通用推理模型在国际数学奥林匹克竞赛(IMO)中达到金牌水平(35/42分)。2025年11月,OpenAI发布了“早期加速科学实验:GPT-5”,展示了GPT-5在数学、物理、生物学等领域帮助研究者取得具体进展的案例,同时指出了观察到的局限性。最近,OpenAI报告了一项物理合作成果:GPT-5.2提出了一个胶子振幅公式的候选表达式,随后由内部模型正式证明并得到作者验证。
OpenAI期待与社区更深入合作,共同评估研究级推理能力,包括对这些尝试的专家反馈。同时,团队兴奋地宣布,这些新能力将在未来的公开模型中提供。
First Proof提交是AI推理能力的一次重要验证。它不仅展示了AI在科研级问题上的潜力,也暴露了当前方法的局限性。OpenAI将继续推动模型在严谨性、长链推理和专家级验证方面的进步,为未来的科学研究提供更强工具。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

OpenAI销售团队规模一年增长三倍,通过构建GTM Assistant智能助手,将顶尖销售经验系统化,实现销售生产力提升20%,让销售代表每周多出一天时间专注于客户关系。

OpenAI 正式发布 AI 视频生成模型 Sora,通过水印溯源、肖像权控制、青少年保护、内容过滤等多维安全策略,在推动视频创作创新的同时,构建了负责任的 AI 应用框架。

OpenAI 发布 Sora 2,视频生成模型迎来 GPT-3.5 时刻。新模型在物理准确性、可控性上大幅提升,支持同步音效和对话,并推出基于‘角色’功能的社交 iOS 应用。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。