
OpenAI 通过 WebSocket 持久连接将 Responses API 代理循环速度提升 40%,实现从 65 到近 1000 tokens/秒的推理速度飞跃。本文深入解析了背后的技术优化,包括缓存、减少网络跳数、改进安全堆栈,以及构建持久连接的关键设计。
2026年4月22日,OpenAI 工程团队宣布了一项重大性能优化:通过引入 WebSocket 持久连接,将 Responses API 的代理循环端到端速度提升了 40%。这一改进让用户能够体验到推理速度从每秒 65 个 token 跃升至近 1000 个 token 的飞跃。本文由技术人员 Brian Yu 和 Ashwin Nathan 撰写,深入解析了背后的技术细节。
当 Codex 被要求修复一个 bug 时,它会扫描代码库中的相关文件、读取上下文、进行修改,并运行测试来验证修复是否成功。这一过程背后涉及数十次 Responses API 的来回请求:确定模型的下一步行动、在计算机上运行工具、将工具输出返回给 API,然后重复。
所有这些请求累积起来,可能导致用户等待 Codex 完成复杂任务的时间长达数分钟。从延迟角度分析,Codex 代理循环主要花费在三个阶段:API 服务层(验证和处理请求)、模型推理(在 GPU 上生成新 token)以及客户端时间(运行工具和构建模型上下文)。过去,GPU 上的 LLM 推理是最慢的部分,API 开销容易被掩盖。但随着推理速度的提升,代理循环中的累计 API 开销变得显著。
在 Responses API 中,之前的旗舰模型如 GPT-5 和 GPT-5.2 运行速度约为每秒 65 个 token。而 GPT-5.3-Codex-Spark 作为快速编码模型,目标是将速度提升一个数量级:超过 1000 tokens/秒。这得益于专门为 LLM 推理优化的 Cerebras 硬件。
然而,要让用户真正体验到新模型的速度,必须减少 API 开销。2025 年 11 月左右,OpenAI 启动了 Responses API 的性能冲刺,针对单个请求的延迟进行了多项优化:
这些改进使首 token 时间(TTFT)提升了约 45%,但对于 GPT-5.3-Codex-Spark 来说仍不够快。即使有了这些优化,Responses API 的开销相对于模型速度仍然过大——用户必须先等待运行 API 的 CPU,然后才能使用提供模型的 GPU。
更深层次的问题在于结构:每个 Codex 请求都被视为独立请求,在每个后续请求中重复处理对话状态和其他可重用上下文。即使大部分对话内容未发生变化,系统仍会为完整历史记录支付处理成本。随着对话变长,这种重复处理变得更加昂贵。
为了优化设计,团队重新思考了传输协议:能否保持持久连接并缓存状态,而不是每次后续请求都通过 HTTP 建立新连接并发送完整对话历史?这个想法是只发送需要验证和处理的新信息,并在连接的生命周期内将可重用状态缓存在内存中,从而减少冗余工作的开销。
团队评估了几种方案,包括 WebSocket 和 gRPC 双向流。最终选择了 WebSocket,因为它作为一种简单的消息传输协议,用户无需更改 Responses API 的输入和输出格式。它对开发者友好,且对现有架构的干扰最小。
第一个 WebSocket 原型改变了团队对 Responses API 延迟的认知。Codex 团队的一名工程师凭借对 API 堆栈的深厚专业知识,通过一夜运行 Codex 代理构建了原型。
在该原型中,代理循环被建模为单个长时间运行的响应。利用 asyncio 特性,Responses API 在工具调用采样后异步阻塞在采样循环中,并发送 response.done 事件给客户端。客户端执行工具调用后,发送 response.append 事件并携带工具结果,从而解除采样循环的阻塞,让模型继续执行。
这类似于将本地工具调用视为托管工具调用。当模型调用 web search 时,推理循环会阻塞,调用 web search 服务,并将服务响应放入模型上下文。在设计中,团队做了同样的事情,但不同的是,他们将模型的工具调用通过 WebSocket 发送给客户端。当客户端响应时,将客户端的工具调用响应放入上下文并继续采样。
这种设计非常有效,因为它消除了代理循环中的重复 API 工作。推理前工作只需执行一次,暂停等待工具执行,然后在最后执行一次推理后工作。
尽管原型有效,但代价是 API 形状变得不太熟悉且更复杂。团队希望开发者能够直接使用 WebSocket 支持,而无需围绕新的交互模式重写 API 集成。
最终发布的版本恢复了熟悉的形状:继续使用 response.create 并保持相同的请求体,通过 previous_response_id 从上一个响应延续对话上下文。这样既保留了开发者熟悉的接口,又实现了底层的增量优化。
通过 WebSocket 持久连接,OpenAI 成功将 Responses API 的代理循环延迟降低了 40%,让用户能够真正体验到 GPT-5.3-Codex-Spark 接近 1000 tokens/秒的推理速度。这一优化不仅减少了 API 开销,还为未来的代理工作流奠定了更高效的基础。
对于开发者而言,这意味着更快的响应时间、更低的延迟,以及更流畅的 AI 交互体验。OpenAI 表示,将继续探索更多性能优化,推动 AI 代理工作流进入新的时代。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

OpenAI销售团队规模一年增长三倍,通过构建GTM Assistant智能助手,将顶尖销售经验系统化,实现销售生产力提升20%,让销售代表每周多出一天时间专注于客户关系。

OpenAI 正式发布 AI 视频生成模型 Sora,通过水印溯源、肖像权控制、青少年保护、内容过滤等多维安全策略,在推动视频创作创新的同时,构建了负责任的 AI 应用框架。

OpenAI 发布 Sora 2,视频生成模型迎来 GPT-3.5 时刻。新模型在物理准确性、可控性上大幅提升,支持同步音效和对话,并推出基于‘角色’功能的社交 iOS 应用。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。