
GPT-6.1 Sol 是 OpenAI 对 GPT-6 Sol 的升级版,在智能体编程、专业文档理解与计算机操作上接近旗舰 GPT-6 Astra,但标准输入输出价格仅为后者五分之一,缓存输入低至每百万 token 0.10 美元,主打高性价比的智能体规模化调用。
OpenAI 近日推出 GPT-6.1 Sol,这是对 GPT-6 Sol 的一次重要升级。从官方披露的信息看,新模型在智能体编程、计算机操作与专业工作任务上,已经非常接近旗舰级 GPT-6 Astra 的水平,而标准输入与输出 token 价格仅为后者的五分之一。更值得关注的是缓存输入价格降至每百万 token 0.10 美元,比标准输入便宜约 95%,也比 GPT-6 Sol 的缓存价格低一半。对于需要反复复用上下文、持续运行智能体的开发者而言,这一价格结构释放出的构建空间相当可观。
过去一年,大模型竞赛的主线往往是刷新榜单最高分。GPT-6.1 Sol 的定位则明显不同:它不追求取代 Astra,而是把接近顶级模型的能力下放到更可负担的价位。官方将其描述为在日常专业工作中提供新的能力与成本平衡点。
从 GPT-6 Sol 到 GPT-6.1 Sol,提升集中在写作与调试代码、理解文档、执行多步骤业务流程等复杂专业任务上。在多项评测中,它的表现已经逼近 Astra,但成本大幅下降。这种「次旗舰」策略,实际上回应了企业落地时最现实的顾虑——不是模型不够聪明,而是规模化调用太贵。
在评估真实代码库中复杂软件工程任务的 DeepSWE v1.1 上,GPT-6.1 Sol 在约五分之一成本下追平了 GPT-6 Astra;相较 GPT-6 Sol 的最佳成绩,它在更低的推理强度与成本下高出 6.4 个百分点。这意味着团队可以在不显著增加预算的前提下,处理更长周期、更接近真实项目的编程任务。
专业文档理解方面,GDP.pdf 测试模型对包含表格、图表、示意图与细则的复杂 PDF 的回答准确度。GPT-6.1 Sol 在该项上的得分超过了带 fallback 的 Opus 5.5,而每任务成本不到后者一半;同时它以约五分之一的任务成本接近 Astra 的领先水平。对于金融、医疗、法律等需要精读长文档的场景,这一差距直接关系到单位业务成本。
业务流程自动化方面,AutomationBench 考察智能体能否正确完成多步骤业务工作流。在中等推理强度下,GPT-6.1 Sol 比 Opus 5.5 高出 2.2 个百分点,成本约为其三分之一;同一设置下也比 GPT-6 Sol 提升 4.8 个百分点。该测试覆盖销售、市场、运营、支持、财务与人力资源等 47 种工具。
在 OSWorld 2.0 离线集上,GPT-6.1 Sol 于最高推理强度下比 GPT-6 Sol 高出 7 个百分点,成本却不到一半;与 Astra 的差距缩小到 2.1 个百分点,而每任务成本约为其七分之一。这类评测针对跨日常与专业场景的长周期计算机操作流程,对智能体的稳定性要求很高。
科研工作流方面,Terminal-Bench Science 0.1 覆盖数据分析、模拟与定理证明等任务。最高推理强度下,GPT-6.1 Sol 的得分是 GPT-6 Sol 的两倍以上,每任务成本不到一半。其平均每任务成本为 5.47 美元,而 Opus 5.5 为 23.21 美元、Astra 为 23.80 美元,降幅超过 75%。不过 Astra 仍以 68.1% 保持最高分,最困难的科研任务仍应交给它。
事实性方面,GPT-6.1 Sol 在低推理强度下的提升最明显:含事实错误的回答占比从 11.4% 降至 7.7%,降幅约 32%。在各测试推理设置下,其错误率与 Astra 的差距保持在 1.9 个百分点以内,而每任务成本不到后者五分之一。需要说明的是,该评测基于用户曾标记过错误的脱敏对话,属于刻意挑选的困难样本,并不代表日常使用中的错误率。
安全对齐方面,GPT-6.1 Sol 相比 GPT-6 Sol 有明显进步,更接近 Astra。它对自身局限更透明,在尊重用户意图与安全约束上更可靠;在搜索工具失效的说明、遵守明确限制、避免智能体任务中出现未授权结果等挑战性评测中,失败率低于 GPT-6 Sol。官方表示未观察到绕过自动安全审查的尝试,与 Astra 和 GPT-6 Sol 表现一致。
GPT-6.1 Sol 即日起面向 ChatGPT Work 与 Codex 中的 Plus、Pro、Business、Enterprise 与 Edu 用户开放,暂未进入 Chat。开发者可通过 API 以 gpt-6.1-sol 调用,标准价格为每百万输入 token 2 美元、每百万缓存输入 token 0.10 美元、每百万输出 token 10 美元。官方还预告将推出 GPT-6.1 Sol Ultrafast,token 生成速度最高提升 8 倍。
把这一动态放回国内语境看,性价比路线并非 OpenAI 独有。DeepSeek 长期以激进的定价策略推动推理成本下探,通义千问与豆包在多模态和长文档处理上持续迭代,Kimi 以长上下文见长,智谱 GLM 与讯飞星火则在政企与行业场景中强调可控部署。差异在于,OpenAI 此次把「接近旗舰」的能力与缓存复用机制绑定,瞄准的是高频、长周期的智能体调用;国内厂商更多从开源权重、私有化部署与行业适配切入。对开发者而言,两条路线的共同信号是:智能体的单位任务成本正在快速下降,应用层创新的门槛随之降低。
想要了解模型能力的官方口径,可参考 OpenAI 官方发布页 与 GPT-6.1 Sol 系统卡附录;关于智能体评测方法论的背景,可查阅 Wikipedia 上关于大语言模型的条目。
GPT-6.1 Sol 是 GPT-6 Sol 的升级版,定位为高性价比的次旗舰模型。它在智能体编程、计算机操作与专业工作任务上接近 Astra 的水平,但标准输入输出价格仅为 Astra 的五分之一,并不取代 Astra 在最高难度任务上的位置。
标准价格为每百万输入 token 2 美元、每百万缓存输入 token 0.10 美元、每百万输出 token 10 美元。缓存输入比标准输入便宜约 95%,适合需要跨请求复用上下文的智能体场景。
目前它面向 ChatGPT Work 与 Codex 中的 Plus、Pro、Business、Enterprise 和 Edu 用户开放,尚未进入 Chat。开发者可以通过 API 以 gpt-6.1-sol 模型名调用。
有。在低推理强度下,含事实错误的回答占比从 11.4% 降至 7.7%,降幅约 32%。不过该数据来自用户标记过错误的困难样本,日常使用中的错误率通常更低。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

OpenAI 将 Lenfest 新闻研究所 AI 奖学金计划的支持力度翻倍,追加 500 万美元资金及软件额度。这场历时两年的实验证明,新闻业 AI 落地的关键不在技术,而在信任、协作与对组织真实需求的理解。

端侧AI的竞争焦点正从模型参数量转向任务闭环能力。芯片厂商通过异构计算、多模型协作和生态整合,试图让智能体在手机上真正跑通工作流,但成本、迭代速度和跨终端协作仍是待解难题。

Harvey 借助 GPT-6 Astra 把法院信息、律所文档与判例研究等上下文引入起草流程,输出更结构化、更贴近案件的法律文书,让律师把时间留给策略判断。
최신 SEO·GEO 정보를 받아보세요.
개인정보를 존중합니다. 언제든 구독을 취소할 수 있습니다.