Bingdada Tech BlogBingdada Tech Blog
HomeBlogSEOGEOAEOAIToolsAbout
Log inSign up
Logo

Bingdada Tech Blog

A technical blog focused on SEO, GEO, and future AI trends.

Quick Links

  • Home
  • Blog Posts
  • About Us

Contact

  • 398848662@qq.com

Subscribe to our Newsletter for the latest SEO and GEO insights.

© 2024 Bingdada 技术博客. All rights reserved.

This article is in Simplified Chinese. Translate it to English with one click.
HomeBlogAI人工智能GPT-6.1 Sol 发布:以五分之一成本逼近 Astra 的智能体能力意味着什么
GPT-6.1 Sol 发布:以五分之一成本逼近 Astra 的智能体能力意味着什么
AI人工智能

GPT-6.1 Sol 发布:以五分之一成本逼近 Astra 的智能体能力意味着什么

bingdadabingdada
September 30, 20269 reads7 min read
Quick Answer

GPT-6.1 Sol 是 OpenAI 对 GPT-6 Sol 的升级版,在智能体编程、专业文档理解与计算机操作上接近旗舰 GPT-6 Astra,但标准输入输出价格仅为后者五分之一,缓存输入低至每百万 token 0.10 美元,主打高性价比的智能体规模化调用。

Key Takeaways
  • GPT-6.1 Sol 定位为高性价比次旗舰,能力逼近 Astra 而成本仅为其五分之一。
  • 缓存输入价格降至每百万 token 0.10 美元,比标准输入便宜约 95%,利于上下文复用。
  • 在 DeepSWE、GDP.pdf、AutomationBench、OSWorld 2.0 等评测中,它以更低成本接近或超越竞品。
  • 低推理强度下含事实错误的回答占比从 11.4% 降至 7.7%,安全对齐也优于 GPT-6 Sol。
  • API 标准价为输入 2 美元、缓存输入 0.10 美元、输出 10 美元每百万 token,暂未进入 Chat。
Contents

Contents

  • 一次围绕「性价比」而非「极限分数」的升级
  • 编程、专业文档与业务流程:三项关键评测
  • 计算机操作与科研:长周期任务的成本曲线
  • 事实准确性与安全对齐的同步改善
  • 定价、可用性与国内视角
  • 常见问题
  • GPT-6.1 Sol 和 GPT-6 Astra 是什么关系?
  • GPT-6.1 Sol 的 API 价格是多少?
  • 普通 ChatGPT 用户现在能用 GPT-6.1 Sol 吗?
  • GPT-6.1 Sol 在事实准确性上有提升吗?
  • 国内用户该如何看待这次发布?
  • 关于 Bingdada

OpenAI 近日推出 GPT-6.1 Sol,这是对 GPT-6 Sol 的一次重要升级。从官方披露的信息看,新模型在智能体编程、计算机操作与专业工作任务上,已经非常接近旗舰级 GPT-6 Astra 的水平,而标准输入与输出 token 价格仅为后者的五分之一。更值得关注的是缓存输入价格降至每百万 token 0.10 美元,比标准输入便宜约 95%,也比 GPT-6 Sol 的缓存价格低一半。对于需要反复复用上下文、持续运行智能体的开发者而言,这一价格结构释放出的构建空间相当可观。

一次围绕「性价比」而非「极限分数」的升级

过去一年,大模型竞赛的主线往往是刷新榜单最高分。GPT-6.1 Sol 的定位则明显不同:它不追求取代 Astra,而是把接近顶级模型的能力下放到更可负担的价位。官方将其描述为在日常专业工作中提供新的能力与成本平衡点。

从 GPT-6 Sol 到 GPT-6.1 Sol,提升集中在写作与调试代码、理解文档、执行多步骤业务流程等复杂专业任务上。在多项评测中,它的表现已经逼近 Astra,但成本大幅下降。这种「次旗舰」策略,实际上回应了企业落地时最现实的顾虑——不是模型不够聪明,而是规模化调用太贵。

编程、专业文档与业务流程:三项关键评测

在评估真实代码库中复杂软件工程任务的 DeepSWE v1.1 上,GPT-6.1 Sol 在约五分之一成本下追平了 GPT-6 Astra;相较 GPT-6 Sol 的最佳成绩,它在更低的推理强度与成本下高出 6.4 个百分点。这意味着团队可以在不显著增加预算的前提下,处理更长周期、更接近真实项目的编程任务。

专业文档理解方面,GDP.pdf 测试模型对包含表格、图表、示意图与细则的复杂 PDF 的回答准确度。GPT-6.1 Sol 在该项上的得分超过了带 fallback 的 Opus 5.5,而每任务成本不到后者一半;同时它以约五分之一的任务成本接近 Astra 的领先水平。对于金融、医疗、法律等需要精读长文档的场景,这一差距直接关系到单位业务成本。

业务流程自动化方面,AutomationBench 考察智能体能否正确完成多步骤业务工作流。在中等推理强度下,GPT-6.1 Sol 比 Opus 5.5 高出 2.2 个百分点,成本约为其三分之一;同一设置下也比 GPT-6 Sol 提升 4.8 个百分点。该测试覆盖销售、市场、运营、支持、财务与人力资源等 47 种工具。

计算机操作与科研:长周期任务的成本曲线

在 OSWorld 2.0 离线集上,GPT-6.1 Sol 于最高推理强度下比 GPT-6 Sol 高出 7 个百分点,成本却不到一半;与 Astra 的差距缩小到 2.1 个百分点,而每任务成本约为其七分之一。这类评测针对跨日常与专业场景的长周期计算机操作流程,对智能体的稳定性要求很高。

科研工作流方面,Terminal-Bench Science 0.1 覆盖数据分析、模拟与定理证明等任务。最高推理强度下,GPT-6.1 Sol 的得分是 GPT-6 Sol 的两倍以上,每任务成本不到一半。其平均每任务成本为 5.47 美元,而 Opus 5.5 为 23.21 美元、Astra 为 23.80 美元,降幅超过 75%。不过 Astra 仍以 68.1% 保持最高分,最困难的科研任务仍应交给它。

事实准确性与安全对齐的同步改善

事实性方面,GPT-6.1 Sol 在低推理强度下的提升最明显:含事实错误的回答占比从 11.4% 降至 7.7%,降幅约 32%。在各测试推理设置下,其错误率与 Astra 的差距保持在 1.9 个百分点以内,而每任务成本不到后者五分之一。需要说明的是,该评测基于用户曾标记过错误的脱敏对话,属于刻意挑选的困难样本,并不代表日常使用中的错误率。

安全对齐方面,GPT-6.1 Sol 相比 GPT-6 Sol 有明显进步,更接近 Astra。它对自身局限更透明,在尊重用户意图与安全约束上更可靠;在搜索工具失效的说明、遵守明确限制、避免智能体任务中出现未授权结果等挑战性评测中,失败率低于 GPT-6 Sol。官方表示未观察到绕过自动安全审查的尝试,与 Astra 和 GPT-6 Sol 表现一致。

定价、可用性与国内视角

GPT-6.1 Sol 即日起面向 ChatGPT Work 与 Codex 中的 Plus、Pro、Business、Enterprise 与 Edu 用户开放,暂未进入 Chat。开发者可通过 API 以 gpt-6.1-sol 调用,标准价格为每百万输入 token 2 美元、每百万缓存输入 token 0.10 美元、每百万输出 token 10 美元。官方还预告将推出 GPT-6.1 Sol Ultrafast,token 生成速度最高提升 8 倍。

把这一动态放回国内语境看,性价比路线并非 OpenAI 独有。DeepSeek 长期以激进的定价策略推动推理成本下探,通义千问与豆包在多模态和长文档处理上持续迭代,Kimi 以长上下文见长,智谱 GLM 与讯飞星火则在政企与行业场景中强调可控部署。差异在于,OpenAI 此次把「接近旗舰」的能力与缓存复用机制绑定,瞄准的是高频、长周期的智能体调用;国内厂商更多从开源权重、私有化部署与行业适配切入。对开发者而言,两条路线的共同信号是:智能体的单位任务成本正在快速下降,应用层创新的门槛随之降低。

想要了解模型能力的官方口径,可参考 OpenAI 官方发布页 与 GPT-6.1 Sol 系统卡附录;关于智能体评测方法论的背景,可查阅 Wikipedia 上关于大语言模型的条目。

常见问题

GPT-6.1 Sol 和 GPT-6 Astra 是什么关系?

GPT-6.1 Sol 是 GPT-6 Sol 的升级版,定位为高性价比的次旗舰模型。它在智能体编程、计算机操作与专业工作任务上接近 Astra 的水平,但标准输入输出价格仅为 Astra 的五分之一,并不取代 Astra 在最高难度任务上的位置。

GPT-6.1 Sol 的 API 价格是多少?

标准价格为每百万输入 token 2 美元、每百万缓存输入 token 0.10 美元、每百万输出 token 10 美元。缓存输入比标准输入便宜约 95%,适合需要跨请求复用上下文的智能体场景。

普通 ChatGPT 用户现在能用 GPT-6.1 Sol 吗?

目前它面向 ChatGPT Work 与 Codex 中的 Plus、Pro、Business、Enterprise 和 Edu 用户开放,尚未进入 Chat。开发者可以通过 API 以 gpt-6.1-sol 模型名调用。

GPT-6.1 Sol 在事实准确性上有提升吗?

有。在低推理强度下,含事实错误的回答占比从 11.4% 降至 7.7%,降幅约 32%。不过该数据来自用户标记过错误的困难样本,日常使用中的错误率通常更低。

国内用户该如何看待这次发布?

它反映的是智能体调用成本快速下降的行业趋势。国内 DeepSeek、通义千问、豆包、Kimi、智谱 GLM 等也在各自路线上推进,差异主要体现在开源策略、私有化部署与行业适配,开发者可结合合规与成本要求选择。

关于 Bingdada

Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。

编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com

© 2026 Bingdada. 保留所有权利。

Contents

  • 一次围绕「性价比」而非「极限分数」的升级
  • 编程、专业文档与业务流程:三项关键评测
  • 计算机操作与科研:长周期任务的成本曲线
  • 事实准确性与安全对齐的同步改善
  • 定价、可用性与国内视角
  • 常见问题
  • GPT-6.1 Sol 和 GPT-6 Astra 是什么关系?
  • GPT-6.1 Sol 的 API 价格是多少?
  • 普通 ChatGPT 用户现在能用 GPT-6.1 Sol 吗?
  • GPT-6.1 Sol 在事实准确性上有提升吗?
  • 国内用户该如何看待这次发布?
  • 关于 Bingdada
FAQ
Premium Ad Space · Limited Time
Advertise with us

Put your brand in the reader feed

In-article ad slots: high-attention moments perfect for product launches and event recruitment.

Partnership

Tags

#OpenAI News#智能体#API 定价#GPT-6 Astra#GPT-6.1 Sol
bingdada

bingdada

SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

Related Posts

OpenAI 加码新闻业 AI 落地:Lenfest 奖学金计划扩容的深层启示
AI人工智能

OpenAI 加码新闻业 AI 落地:Lenfest 奖学金计划扩容的深层启示

OpenAI 将 Lenfest 新闻研究所 AI 奖学金计划的支持力度翻倍,追加 500 万美元资金及软件额度。这场历时两年的实验证明,新闻业 AI 落地的关键不在技术,而在信任、协作与对组织真实需求的理解。

Sep 297 min read
端侧AI的下一站:芯片厂商如何让智能体真正跑通工作流
国产 AI 前线

端侧AI的下一站:芯片厂商如何让智能体真正跑通工作流

端侧AI的竞争焦点正从模型参数量转向任务闭环能力。芯片厂商通过异构计算、多模型协作和生态整合,试图让智能体在手机上真正跑通工作流,但成本、迭代速度和跨终端协作仍是待解难题。

Sep 288 min read
法律AI新拐点:Harvey借GPT-6 Astra把「上下文」变成文书竞争力
AI人工智能

法律AI新拐点:Harvey借GPT-6 Astra把「上下文」变成文书竞争力

Harvey 借助 GPT-6 Astra 把法院信息、律所文档与判例研究等上下文引入起草流程,输出更结构化、更贴近案件的法律文书,让律师把时间留给策略判断。

Sep 287 min read

Subscribe to our Newsletter

Get the latest SEO & GEO insights.

We respect your privacy. You can unsubscribe at any time.

Comments ({count}) (0)

Sign in to join the discussion

Sign inSign up
No comments yet, be the first to comment