
OpenAI发布GPT-5.6模型家族,旗舰模型Sol以不到一半成本超越Claude Fable 5。通过负载均衡、推测解码、内核优化等创新,实现智能与效率的双重突破,让AI更普惠。
2026年7月29日,OpenAI正式发布了GPT-5.6模型家族,这一系列模型在设计之初就致力于在各类任务场景下实现能力与成本的精妙平衡。旗舰模型GPT-5.6 Sol在最大推理模式下,以不到一半的成本超越了Claude Fable 5在Artificial Analysis Coding Agent Index上的表现;Terra模型在智能基准测试中与GPT-5.5持平,但价格仅为后者的一半;而Luna则是目前最快、最实惠的模型,定价比Sol低80%。这些效率提升的背后,是研究和技术团队在模型堆栈的每一个关键层面所做出的重大优化——涵盖模型本身、推理过程(即模型生成输出的运行方式),以及Codex和ChatGPT Work所使用的代理框架。
在过去四年中,OpenAI的模型已扩展至10亿活跃用户和超过200万企业客户。效率,始终是让智能惠及每一个人的关键所在。我们的使命是确保通用人工智能造福全人类。为此,我们不断在堆栈的各个层面解锁更深层的优化,力求在成本-智能曲线上提供性能最优的模型。通过GPT-5.6,我们实现了迄今为止最高的每Token智能效率——模型被训练为在每一个Token上完成更多工作。在训练过程中,我们同时优化任务成功率和效率,引导模型以更直接的路径完成任务。
本文将从模型之外的角度,分享我们如何通过两大堆栈的进步来提升效率:1) 推理优化,包括负载均衡、推测解码、缓存和内核优化等,从而在相同硬件上获得更多输出;2) 代理框架优化,包括更好地管理上下文膨胀、工具使用和重复工作。我们还将揭示GPT-5.6 Sol如何自主实现其中多项增益。尽管单个改进看似有限,但这些成果的叠加效应,使我们能够同时站在智能与效率的前沿。
在一个计算资源受限、模型需求增速超过算力供给的世界里,效率是每个系统设计的核心。这一点在推理堆栈中尤为关键——推理堆栈负责运行训练好的模型以生成响应。我们的首要目标是在保持用户期望的智能水平、延迟、可用性和可靠性的前提下,用相同的硬件服务更多Token。
实现这一目标需要优化整个系统。一个模型本身可能效率极高,但如果请求分配不当、硬件闲置或数据移动拖慢计算,其服务成本依然高昂。每一层的改进都会产生叠加效应,增益来自路由(请求发送到哪里)、调度(请求何时发送)、内核(在GPU上运行的软件)、缓存(保存和复用计算结果)和模型实现(GPU代码的执行顺序)的优化。而Codex中的GPT-5.6 Sol在这些优化中扮演了不可或缺的角色。
第一个重要例子是负载均衡。在全球范围内,我们根据地理位置、可用容量和加速器类型(运行模型的GPU或专用芯片类型)来路由请求。在一个集群内部,我们根据负载、上下文长度、缓存可用性和其他请求属性,将工作分配给不同的模型实例。在每个实例内部,工作必须高效地分配到加速器、子网络和计算核心。Codex中的GPT-5.6 Sol帮助我们分析生产流量,识别之前被忽视的不平衡来源,测试新的路由策略,并持续调整这些启发式规则。仅负载均衡的改进,就大幅降低了模型的服务成本。
我们还利用GPT-5.6 Sol优化了模型的前向传播——即从输入到下一个Token预测的计算过程。即使单个操作很快,过多的内存移动、同步和低效的数据布局也可能让GPU闲置。为了避免这种情况,GPT-5.6 Sol找出了可以预计算、避免或并行化的工作。借助Codex,GPT-5.6 Sol自主重写并优化了我们的生产内核——即执行组成模型的数学运算的核心代码。这一成果部分得益于我们训练GPT-5.6时使其擅长使用Triton和Gluon(两种由OpenAI维护的开源GPU编程语言)编写和优化内核。这些努力,加上GPT-5.6 Sol带来的更广泛的内核改进,将端到端服务成本降低了20%。我们还大力投资了验证工具,例如开源工具FpSan(浮点清理器),以帮助验证GPT-5.6 Sol所编写内核的正确性。
推测解码是提高速度和效率的另一个杠杆。该技术涉及在主模型旁边运行一个较小的草稿(或“推测”)模型,由它提出多个Token供主模型并行验证。当这些提案被接受时,系统可以通过一次主模型前向传播产生多个输出Token,从而减少昂贵的顺序计算量。GPT-5.6 Sol通过在其架构上设计并运行数百次实验,测试大小、结构和特征的变化,改进了自己的草稿模型。此外,GPT-5.6 Sol启动并监控了推测器的训练过程,在出现硬件故障或训练不稳定等问题时自主干预。这些改进使Token生成效率提升了15%以上。
当处理未缓存的输入Token时,模型会通过一次计算密集型的前向传播构建键值缓存;而在生成输出时,它会反复读取并扩展该缓存。GPT-5.6 Sol通过智能分析缓存命中率、预测未来请求模式,并自动调整缓存策略,显著减少了重复计算。这些优化不仅降低了延迟,还进一步提升了硬件利用率。
除了推理优化,代理框架的效率提升同样关键。在Codex和ChatGPT Work中,代理需要处理上下文膨胀、工具调用和重复工作等问题。GPT-5.6 Sol通过以下方式优化了代理框架:
这些优化使得代理在处理复杂任务时更加高效,同时保持了高水平的智能表现。
GPT-5.6模型家族代表了OpenAI在智能与效率融合方面的最新突破。从模型训练到推理优化,从负载均衡到内核重写,从推测解码到智能缓存,每一层改进的叠加效应使我们能够以更低的成本提供更强大的智能。这不仅是技术上的进步,更是我们使命的体现——让通用人工智能真正惠及全人类。随着GPT-5.6的发布,我们正在开启一个智能更加普及、效率更加极致的新时代。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

OpenAI 宣布大幅下调 GPT-5.6 系列模型价格,最高降幅达 80%。文章阐述了其通过全栈创新、提升算力效率、构建良性循环,实现让更强大 AI 以更低成本惠及更多人的战略愿景。

OpenAI工程团队详细解析如何将PostgreSQL扩展至支撑8亿ChatGPT用户,每秒处理数百万次查询。文章深入探讨了单主架构、MVCC优化、查询调优、缓存策略、自动清理等关键技术,并总结了大规模数据库扩展的实战经验。

大多数企业仍将AI视为孤立实验,但领先者已将其视为一套价值模型组合。本文深入剖析五大AI价值模型——劳动力赋能、AI原生分发、专家能力、系统依赖管理与智能体运营,揭示企业如何从试点走向系统性价值重塑。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。