
本文深入解析了OpenAI如何用六个月时间构建GPT-Live实时语音AI系统,从轮次制到全双工流式架构的转变,以及有状态推理、异步委派和协议优化的关键技术。
在语音AI领域,知道何时开口说话比听起来要困难得多。人类说话者能在瞬间无缝切换对话,但以往的语音AI系统却难以跟上这种节奏。它们的轮次制架构依赖于被称为“轮次检测器”的小型模型,这些模型面临着艰巨的任务:猜得太早,用户会被打断;猜得太晚,响应又会显得迟缓。只有检测器做出决定后,更大的LLM才能开始工作。
GPT-Live,我们的第三代语音系统,将轮次检测器从音频路径中移除了。它的语音模型是全双工的,这意味着它可以同时听和说。这消除了对独立检测器的需求,使对话感觉更加即时和自然。当需要更深入的推理或工具使用时,GPT-Live还可以咨询我们的前沿模型,如GPT-5.5,而不会打断对话的流畅性。这些能力共同赋予GPT-Live前所未有的对话响应性和智能组合。
为了大规模提供这种体验,我们需要一种为低延迟优化的新系统架构。与典型的请求-响应推理不同,我们的系统将传入的音频流式输入语音模型,并将传出的语音流式返回给用户,同时在单独的异步路径上处理委派任务。在过去的六个月里,我们重新设计了模型推理、上下文管理和媒体传输,以确保语音从端到端流畅运行。
该架构还在核心语音路径和应用程序逻辑之间建立了清晰的边界。这使得定制应用程序行为变得容易,而不会影响响应性。这一基础支撑了ChatGPT Voice中日益增长的功能,包括新推出的在ChatGPT桌面应用中控制计算机和协调代理的能力。
在这篇文章中,我们将解释为什么早期的轮次制系统无法满足我们的需求,以及我们如何在新系统的每一层工程化响应性。我们将涵盖有状态推理、动态上下文管理、异步委派和协议级优化,所有这些协同工作,使GPT-Live真正“活”起来。
早期的语音架构继承了文本LLM的轮次制特性,但每一轮表示为离散的音频块而不是文本。在级联系统中,语音转文本、LLM和文本转语音依次运行。这种顺序增加了延迟,并忽略了语调和节奏等线索。
语音到语音模型通过直接处理音频改进了这种方法。训练模型原生理解和生成语音,使其能够保留转录中丢失的细节并更快地响应。但系统仍然依赖轮次检测器来决定推理何时开始。模型处理了更多的交互,但交互仍然是轮次制的。
GPT-Live将语音模型置于对话的控制之中:音频流入和流出模型,而更深入的推理和工具使用则异步进行。系统的主要工作是维持一个不间断的媒体循环。其他工作,如调用前沿模型和持久化对话,在实时路径之外进行。
保持这个媒体循环不间断并不总是简单的。传输、处理或推理中的任何延迟都可能变成可听的停顿或伪影。以前的轮次制系统可以容忍音频块到达时间的一些变化。然而,实时媒体系统需要按时传递每个音频帧。
早期在ChatGPT Voice和Realtime API上的工作为我们提供了重要的基础。我们已经重建了语音基础设施,以更低和更可预测的延迟直接流式传输音频和视频进出我们的系统。GPT-Live进一步推动了这一设计,通过一个新的有状态推理系统,将媒体一直流式传输到模型中,专为连续对话而构建。
流式推理只是解决方案的一部分。为了在生产中良好运行,我们还必须确保从客户端到推理栈的可靠音频传输,并处理有状态性的挑战。
我们早期的一个决定是明确地将媒体流与应用程序和业务逻辑分开。音频在客户端和语音模型之间通过专用的快速路径移动。委派、工具使用和其他应用程序工作在异步RPC边界后面进行。缓慢的工具调用或后端服务可能会延迟自己的结果,但不会阻碍媒体的流动。
这种分离还为系统提供了清晰的自定义边界。应用程序可以更改其工具、策略和后端行为,而不会影响负责保持音频移动的媒体前端。实时路径保持小巧、可预测,并专注于必须实时完成的工作。
我们用Go编写了媒体前端和推理逻辑,取代了之前的Python asyncio实现。这显著改善了帧传输的平滑性,新系统的p95与旧系统的p50相当。
WebRTC提供了传输基础。它专为低延迟媒体设计,可以在丢包、时钟漂移和客户端连接变化时继续运行。如果数据包延迟到达,WebRTC可以微妙地拉伸音频以防止间隙,然后短暂加速播放以赶上实时。
通过最小化整个系统中的缓冲和阻塞,我们可以提供人类在对话中期望的亚秒级响应性。
有状态推理有其自身的操作权衡。语音会话可能长时间保持活动,但其上下文不断增长,模型实例根据需求上下调整。我们设计了动态上下文管理,以高效地处理长期对话,同时不牺牲响应性。
我们的系统能够智能地压缩和修剪上下文,确保模型始终拥有最相关的信息,而不会陷入过时的数据。这种动态管理允许GPT-Live在长时间会话中保持连贯性和上下文意识,而不会增加延迟。
此外,我们实现了异步委派机制,使语音模型可以快速响应,同时将更复杂的推理任务(如调用GPT-5.5)委托给后台。这种分层方法确保了实时路径保持轻量,而深度智能仍然可用。
我们还在协议层面进行了优化,以减少开销并提高效率。通过精心设计WebRTC数据通道和媒体流,我们最小化了头部开销和信令延迟。我们还实现了自适应比特率控制,根据网络条件动态调整,确保音频质量在变化的环境中保持稳定。
这些优化共同作用,使GPT-Live能够在各种网络条件下提供流畅、自然的对话体验,从高速Wi-Fi到移动网络。
GPT-Live代表了语音AI的重大进步,通过全双工模型、流式推理和异步委派,实现了人类级别的对话响应性。我们的架构不仅提高了性能,还为未来的创新奠定了基础。随着我们继续优化和扩展,GPT-Live将解锁更多应用场景,从实时翻译到智能助手,彻底改变我们与AI交互的方式。
通过将实时路径与应用程序逻辑分离,我们创建了一个灵活、可扩展的系统,能够适应不断变化的需求。这不仅是技术上的胜利,更是用户体验的飞跃。我们期待看到开发者和用户如何利用GPT-Live的潜力,创造更自然、更智能的对话体验。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

OpenAI销售团队规模一年增长三倍,通过构建GTM Assistant智能助手,将顶尖销售经验系统化,实现销售生产力提升20%,让销售代表每周多出一天时间专注于客户关系。

OpenAI 正式发布 AI 视频生成模型 Sora,通过水印溯源、肖像权控制、青少年保护、内容过滤等多维安全策略,在推动视频创作创新的同时,构建了负责任的 AI 应用框架。

OpenAI 发布 Sora 2,视频生成模型迎来 GPT-3.5 时刻。新模型在物理准确性、可控性上大幅提升,支持同步音效和对话,并推出基于‘角色’功能的社交 iOS 应用。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。