
2026年7月8日,OpenAI 正式发布了新一代语音模型 GPT-Live,旨在让用户与 AI 的语音对话更加自然、流畅,就像与真人交谈一样。这一重大更新已集成到 ChatGPT 的语音功能中,标志着 OpenAI News 在人工智能交互领域迈出了关键一步。GPT-Live 不仅提升了语音交互的体验,还为未来更复杂的智能体任务奠定了基础。
GPT-Live 的核心创新在于其 全双工架构,这意味着它能够同时进行“听”和“说”。与传统的语音系统不同,GPT-Live 不再需要等待用户说完才能回应。在对话过程中,它可以通过“嗯”、“对”等语气词表示正在倾听,能够快速进行你来我往的对话,也可以在用户需要思考时保持安静。这种设计让语音交互变得前所未有的轻松自然。
除了交互方式上的革新,GPT-Live 还是 OpenAI 迄今为止 最智能的语音模型。当遇到需要网络搜索、深度推理或复杂任务的问题时,GPT-Live 会自动在后台调用最新的前沿模型(如 GPT-5.5)进行处理,并将结果无缝融入当前对话。在后台模型工作时,GPT-Live 仍能保持与用户的对话流畅进行。
目前,GPT-Live 默认使用 GPT-5.5 作为后台模型。随着 OpenAI 发布新的前沿模型,GPT-Live 将自动更新升级,确保用户始终获得最先进的 AI 能力。
基于 GPT-Live 的突破性技术,ChatGPT 的语音功能迎来了全面升级。新体验更加智能、自然,让用户与 AI 的协作变得像与真人合作一样顺畅。OpenAI 认为,这项研究最终将解锁语音在更复杂、更长期、更具自主性的任务中的潜力。
从今天开始,OpenAI 向全球 ChatGPT 用户逐步推出两个版本的 GPT-Live:GPT-Live-1 和 GPT-Live-1 mini。同时,OpenAI 计划很快将 GPT-Live 引入 API,开发者和企业可以通过表单注册,第一时间获取通知。
OpenAI 回顾了语音 AI 系统的演进历程,指出过去的方案虽然推动了进步,但都存在明显的权衡。
最初的 ChatGPT 语音功能采用 级联架构,由三个模型串联工作:语音转文本(STT)模型将用户语音转为文字,大语言模型(如 GPT-5.5)生成回复,再通过文本转语音(TTS)模型将文字转回语音。这种方法首次实现了与前沿 AI 模型的语音对话,但信息在模型间传递时可能丢失,且响应速度慢、语气生硬。
后来的 ChatGPT 高级语音模式(Advanced Voice Mode)采用 轮次模型,在单一模型内处理和生成音频,减少了延迟,对话更流畅。但这种方式仍基于离散的“轮次”运作:模型必须等待用户停止说话后才能回应,导致对话显得刻板。此外,由于轮次检测依赖静音,短暂的停顿或背景噪音都可能被误判为说话结束,导致模型在不合适的时机打断用户。
GPT-Live 通过两项关键架构改进解决了上述问题:
首先,GPT-Live 采用全双工架构实现 连续交互。它不再处理一系列独立的消息,而是持续处理输入并同时生成输出。模型可以每秒多次做出交互决策:是说话、继续倾听、暂停、打断,还是调用工具。这使得模型能够进行更自然的对话,更好地把握时间节奏,甚至实现实时翻译。
其次,GPT-Live 将 连续交互 与 深度任务 分离。当用户的问题需要搜索、推理或更强大的智能体能力时,GPT-Live 可以将任务委派给其他模型(如 GPT-5.5)。这样,即使后台在处理多个任务,GPT-Live 也能保持对话继续进行。
这种架构变化还使 GPT-Live 能够持续使用最新的模型和智能体,将前沿智能与自然交互相结合。
OpenAI 建立了全新的人工评估体系,用于衡量对话的愉悦度和流畅度。在头对头比较中,GPT-Live-1 和 GPT-Live-1 mini 在多个维度上 显著优于 高级语音模式:
注:GPT-Live-1(即时版)和 GPT-Live-1 mini 使用 GPT-5.5 Instant 模型;GPT-Live-1 Medium 和 High 版本则使用 GPT-5.5 Thinking 模型,分别采用中等和高推理强度。
目前,每周有超过 1.5亿人 使用 ChatGPT 的语音和听写功能。他们利用语音功能获取免提的日常帮助、练习外语、讲睡前故事,或在通勤时聊天。
从今天起,当用户点击语音按钮与 ChatGPT 对话时,将立即体验到由 GPT-Live 驱动的改进版本。OpenAI 的愿景是创造一个真正自然的人机交互世界:与 AI 协作就像与另一个人合作一样流畅、响应迅速,而推理和复杂任务执行则在后台无缝进行。
GPT-Live 的发布不仅是 OpenAI News 中的一项产品更新,更标志着人机语音交互进入了一个全新纪元。通过全双工架构和深度任务委派,GPT-Live 打破了传统语音系统的局限,让 AI 对话更加自然、智能、高效。随着 GPT-Live 逐步向 API 和开发者开放,我们可以预见,语音交互将在更多场景中发挥关键作用,推动 AI 从工具向真正的协作伙伴演进。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

OpenAI销售团队规模一年增长三倍,通过构建GTM Assistant智能助手,将顶尖销售经验系统化,实现销售生产力提升20%,让销售代表每周多出一天时间专注于客户关系。

OpenAI 正式发布 AI 视频生成模型 Sora,通过水印溯源、肖像权控制、青少年保护、内容过滤等多维安全策略,在推动视频创作创新的同时,构建了负责任的 AI 应用框架。

OpenAI 发布 Sora 2,视频生成模型迎来 GPT-3.5 时刻。新模型在物理准确性、可控性上大幅提升,支持同步音效和对话,并推出基于‘角色’功能的社交 iOS 应用。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。