Bingdada 技术博客Bingdada 技术博客
首页博客SEOGEOAI工具关于
登录注册
Logo

Bingdada 技术博客

专注于SEO搜索引擎优化和GEO生成式引擎优化以及未来人工智能发展趋势的技术博客

快速链接

  • 首页
  • 博客文章
  • 关于我们

联系方式

  • 398848662@qq.com

订阅我们的 Newsletter,获取最新的 SEO 和 GEO 技术资讯。

© 2024 Bingdada 技术博客. All rights reserved.

首页博客AI人工智能开启两个设置,ARC-AGI-3 基准测试得分翻三倍:OpenAI 的 GPT-5.6 Sol 深度优化实践
开启两个设置,ARC-AGI-3 基准测试得分翻三倍:OpenAI 的 GPT-5.6 Sol 深度优化实践
AI人工智能

开启两个设置,ARC-AGI-3 基准测试得分翻三倍:OpenAI 的 GPT-5.6 Sol 深度优化实践

bingdadabingdada
八月 2, 20265 次阅读约 7 分钟阅读
快速回答

OpenAI 发现,通过启用保留推理和压缩两个 API 设置,GPT-5.6 Sol 在 ARC-AGI-3 基准测试中的得分从 13.3% 提升至 38.3%,翻了三倍,同时输出令牌减少 6 倍。这一发现揭示了测试框架设计对 AI 模型性能的关键影响。

核心要点
  • 引言:一个令人困惑的低分谜题
  • 基准测试的隐形影响因素
  • ARC-AGI-3 基准测试解析
  • 问题根源:推理丢弃与滚动截断
  • 解决方案:保留推理与压缩
目录

目录

  • 引言:一个令人困惑的低分谜题
  • 基准测试的隐形影响因素
  • ARC-AGI-3 基准测试解析
  • 问题根源:推理丢弃与滚动截断
  • 解决方案:保留推理与压缩
  • 保留推理:让模型记住思考过程
  • 压缩:替代滚动截断
  • 结果:得分翻三倍,效率提升 6 倍
  • 结论与启示

引言:一个令人困惑的低分谜题

当 OpenAI 研究团队首次看到 GPT-5.6 Sol 在 ARC-AGI-3 基准测试上的低分时,他们感到非常困惑。GPT-5.6 Sol 此前曾成功解决了数学领域长期悬而未决的问题,如 cycle double cover 猜想,并击败了《宝可梦:火红》等游戏。然而,在 ARC-AGI-3——一个由 2D 益智游戏组成的基准测试中,GPT-5.6 Sol 的得分仅为 7.8%,而 GPT-5.5 几乎无法参与游戏,得分仅为可怜的 0.4%。

这引发了团队的深思:是 2D 益智游戏对模型来说异常困难,还是存在其他原因?

基准测试的隐形影响因素

基准测试很少孤立地衡量 AI 模型。它们还衡量了关于 API 设置、测试框架设计和提示的较不显眼的选择。在 ARC-AGI-3 的案例中,OpenAI 发现,开启两个在 ChatGPT 和 Codex 中使用的 API 设置——保留推理和压缩——使公开任务集的得分翻了三倍,并将输出令牌减少了 6 倍。

使用官方测试框架时,GPT-5.6 Sol 在 ARC-AGI-3 公开集上的得分为 13.3%。而启用保留推理和压缩后,得分提升至 38.3%。得分衡量的是相对人类行动效率 (RHAE),这是一种将模型性能与人类基线进行比较的指标。根据官方游戏日志,估计人类测试者的平均得分为 48%。模型不会被告知如何评分,也无法在整个过程中看到自己的分数——行动只返回每帧的文本表示和当前所在关卡。

ARC-AGI-3 基准测试解析

ARC-AGI-3 是一个旨在衡量 AI 智能体学习和推理能力的基准测试。智能体探索不熟悉的 2D 游戏,并在没有明确指令的情况下推断其工作原理。你可以在 arcprize.org/tasks 上玩 25 个演示游戏。

ARC-AGI-3 使用了一个故意通用的测试框架,没有工具或特殊功能。ARC 的理由是,简单的框架使模型的缺点更加明显,并使模型比较更加公平。相比之下,商业开发者会针对每个模型的特性和怪癖优化测试框架。

在游戏领域,GPT-5.6 Sol 曾使用纯视觉框架击败了《宝可梦:火红》,使用 Codex 计算机使用击败了《杀戮尖塔》,并完成了《Baba Is You》的前几个阶段。那么 ARC-AGI-3 有何不同?

问题根源:推理丢弃与滚动截断

受 ARC 对 GPT-5.5 缺点的分析启发,OpenAI 检查了 GPT-5.6 Sol 的一些尝试。与 ARC 一样,他们发现模型似乎不够聪明。它在每个行动上花费很长时间,并且难以取得进展。

但深入调查后,他们发现模型的大部分困惑并非模型本身固有,而是由测试框架的设置引起的。

首先,他们注意到每次游戏行动后,所有私有推理都被丢弃。这意味着每次行动,GPT-5.6 Sol 都被要求重新理解游戏,无法记住过去的思考。模型仍然可以看到过去动作的记录和简短的附带注释,但无法看到导致这些动作的计划、见解或想法。

其次,他们发现测试框架使用了滚动截断窗口,导致随着历史记录的增长,较旧的行动变得不可见。因此,GPT-5.6 Sol 不仅无法记住过去的思考,还失去了对过去行动的记忆。

这两个测试框架特性——丢弃推理和滚动截断——有助于解释为什么 GPT-5.6 Sol 难以随时间学习。

解决方案:保留推理与压缩

保留推理:让模型记住思考过程

OpenAI 的模型在输出回复或工具调用之前,会通过私有推理消息进行思考。这些私有思考消息作为对话历史的一部分被保留。如果对话变得太长,他们会总结并继续。

这是模型训练的方式,也是它们在 ChatGPT 和 Codex 中部署的方式。为了更好地匹配生产设置,OpenAI 使用 Responses API 实现了 ARC-AGI-3 测试框架。他们的 API 使上下文管理变得简单:对于 GPT-5.6,传递先前的响应 ID 可以自动跨工具调用和轮次保留推理。

启用保留推理后,OpenAI 注意到两个重大变化。首先,GPT-5.6 Sol 在每个行动前花费的思考时间更少,因为它不再需要每轮从头开始解释游戏。其次,当它能够记住过去的想法时,GPT-5.6 Sol 在随时间学习和采用连贯策略方面表现更好。

压缩:替代滚动截断

下一个改进来自用压缩替换滚动截断,这是 Responses API 中的另一个设置。

ARC-AGI-3 测试框架通过滚动截断解决上下文限制问题。当对话上下文超过 175,000 个字符时,最旧的消息会被丢弃。

滚动截断有两个缺点。首先,模型会丢失早期的观察和行动。其次,它在大部分任务中使用更完整的上下文窗口操作,这可能会轻微影响性能。

当 OpenAI 在 ARC-AGI-3 上启用压缩时,GPT-5.6 Sol 能够更好地在更长的运行中保留关于每个游戏的知识,并以更少的输出令牌获得更高的分数。

结果:得分翻三倍,效率提升 6 倍

为了说明保留推理和启用压缩的效果,以下动画展示了 GPT-5.6 Sol 在使用不同测试框架解决一系列 ARC-AGI-3 谜题时,其 175K 上下文窗口的变化。

两个中心列展示了不同测试框架如何不同地使用模型上下文窗口。凭借更好的过去记忆,GPT-5.6 Sol 每个行动思考更少,进展更快。注意:OpenAI 的实现使用 175,000 个令牌的限制而不是字符,但这最终会带来显著差异。

结论与启示

这个发现揭示了 AI 基准测试中一个常被忽视的维度:测试框架的设计和 API 设置对模型性能有巨大影响。对于 OpenAI News 而言,这不仅是技术突破,更是对行业标准测试方法的重要反思。

在 ARC-AGI-3 这样的基准测试中,模型的表现不仅取决于其自身能力,还取决于如何配置和调用它。OpenAI 通过优化两个关键设置——保留推理和压缩——显著提升了 GPT-5.6 Sol 的性能,为 AI 智能体的实际部署提供了宝贵经验。

未来,随着 AI 模型在复杂任务中的应用日益广泛,理解并优化这些“隐形”因素将成为提升性能的关键。OpenAI 将继续探索如何通过更好的 API 设计和测试框架,释放模型的全部潜力。

目录

  • 引言:一个令人困惑的低分谜题
  • 基准测试的隐形影响因素
  • ARC-AGI-3 基准测试解析
  • 问题根源:推理丢弃与滚动截断
  • 解决方案:保留推理与压缩
  • 保留推理:让模型记住思考过程
  • 压缩:替代滚动截断
  • 结果:得分翻三倍,效率提升 6 倍
  • 结论与启示
黄金广告位 · 限时招商
广告位招商中

把品牌放进读者的阅读流

文章内广告位,高注意力场景,适合新品发布与活动招募。

商务合作

标签

#OpenAI News#ARC-AGI-3#GPT-5.6 Sol#保留推理#压缩
bingdada

bingdada

SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

相关文章

OpenAI如何用AI提升销售效率与客户成功
AI人工智能

OpenAI如何用AI提升销售效率与客户成功

OpenAI销售团队规模一年增长三倍,通过构建GTM Assistant智能助手,将顶尖销售经验系统化,实现销售生产力提升20%,让销售代表每周多出一天时间专注于客户关系。

8月 4约 5 分钟阅读
OpenAI 正式发布 Sora:负责任地开启 AI 视频生成新时代
AI人工智能

OpenAI 正式发布 Sora:负责任地开启 AI 视频生成新时代

OpenAI 正式发布 AI 视频生成模型 Sora,通过水印溯源、肖像权控制、青少年保护、内容过滤等多维安全策略,在推动视频创作创新的同时,构建了负责任的 AI 应用框架。

8月 4约 6 分钟阅读
Sora 2 正式发布:AI视频生成迎来GPT-3.5时刻
AI人工智能

Sora 2 正式发布:AI视频生成迎来GPT-3.5时刻

OpenAI 发布 Sora 2,视频生成模型迎来 GPT-3.5 时刻。新模型在物理准确性、可控性上大幅提升,支持同步音效和对话,并推出基于‘角色’功能的社交 iOS 应用。

8月 4约 5 分钟阅读

订阅我们的 Newsletter

获取最新的 SEO 与 GEO 技术资讯。

我们尊重您的隐私,随时可以取消订阅。

评论 ({count}) (0)

登录后即可参与讨论

登录注册
还没有评论,来抢沙发吧