
OpenAI 发布三款全新音频模型:GPT-Realtime-2(具备 GPT-5 级推理能力)、GPT-Realtime-Translate(实时翻译 70+ 语言)和 GPT-Realtime-Whisper(流式语音转文本)。这些模型支持语音到行动、系统到语音和语音到语音三大模式,为开发者构建更智能的语音应用提供强大工具。
2026年5月7日,OpenAI 发布了三款全新的音频模型,旨在为开发者解锁新一代的语音应用。这些模型能够实现更自然、更智能的实时语音交互,包括推理、翻译和转录功能。随着语音成为人与软件交互最自然的方式之一,OpenAI 的这一举措标志着语音 AI 从简单的“问答”向真正的“智能助手”迈进了一大步。
GPT-Realtime-2 是 OpenAI 首款具备 GPT-5 级别推理能力的语音模型。它不仅能够处理复杂的请求,还能自然地推进对话。该模型专为实时语音交互设计,能够在推理请求、调用工具、处理打断或错误时保持对话流畅。
核心特性:
性能提升:
GPT-Realtime-Translate 是一款全新的实时翻译模型,支持将 70 多种输入语言翻译成 13 种输出语言,且能与说话者保持同步。该模型特别适合跨语言沟通场景,如国际会议、旅游服务或多语言客服。
应用场景:
GPT-Realtime-Whisper 是一款流式语音转文本模型,能够在说话者讲话的同时实时转录。相比之前的 Whisper 模型,它支持流式处理,延迟更低,适合需要即时文字输出的场景。
应用场景:
OpenAI 观察到,开发者正在围绕三种语音 AI 模式构建应用:
用户通过语音描述需求,系统能够推理请求、使用工具并完成任务。例如,Zillow 正在构建一个助手,可以听、推理并执行“帮我找符合预算的房子,避开繁忙街道,并安排周六看房”这样的请求。
软件将上下文信息转化为实时语音指导。例如,旅行应用可以主动告诉用户:“您的进港航班延误了,但您仍然可以赶上转机。我找到了新登机口,规划了最快的路线,您的行李预计仍能转运。”
AI 帮助实时对话跨越语言、任务或不断变化的上下文。例如,德国电信正在构建语音支持体验,客户可以用最熟悉的语言说话,而模型实时翻译对话。
这些模式还可以协同工作。Priceline 正在朝着用户可以通过语音管理整个旅程的未来迈进:通过对话搜索航班和酒店,处理航班延误后的酒店预订调整,实时获取 TSA 等待时间,并在到达目的地后翻译对话。
GPT-Realtime-2 的核心优势在于其能够在实时语音交互中同时进行推理和行动。以下是其关键技术创新:
并行工具调用:模型可以同时调用多个工具,例如在用户询问“我今晚有时间去吃饭吗?”时,模型可以同时检查日历、搜索附近餐厅并查看交通状况。
工具透明性:通过语音提示“正在检查您的日历”或“正在查找餐厅”,让用户了解 AI 正在执行的操作,增强信任感。
上下文管理:128K 的上下文窗口允许模型记住更长的对话历史,支持多轮复杂任务。例如,用户可以先预订酒店,然后更改日期,再询问附近景点,模型都能保持连贯。
情感与语气控制:模型能够根据对话情境调整语气。当用户遇到问题需要解决时,模型保持冷静和专业;当用户表达喜悦时,模型可以热情回应。
Zillow 正在利用 GPT-Realtime-2 构建一个语音助手,能够理解并执行复杂的房产搜索请求。用户只需说出需求,助手就能调用搜索工具、筛选条件并安排看房。
Priceline 计划让用户通过语音完成整个旅行管理:从搜索航班和酒店,到处理航班延误后的酒店调整,再到实时获取机场信息,最后在目的地进行实时翻译。
德国电信正在构建语音支持系统,客户可以用母语与系统交流,模型实时翻译成客服语言,实现无缝沟通。
对于希望集成这些模型的开发者,OpenAI 提供了以下建议:
OpenAI 表示,这些模型只是语音 AI 发展的一个里程碑。随着技术的进步,我们可以期待:
OpenAI 的新一代语音模型正在将实时音频从简单的“呼叫-响应”模式转变为能够真正工作的语音界面:在对话展开时进行倾听、推理、翻译、转录和行动。对于开发者来说,这意味着他们可以构建更智能、更自然、更实用的语音应用,为用户提供前所未有的体验。
语音作为人机交互的接口,正变得越来越强大。随着这些模型的推出,我们正在进入一个语音 AI 的新时代。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

OpenAI销售团队规模一年增长三倍,通过构建GTM Assistant智能助手,将顶尖销售经验系统化,实现销售生产力提升20%,让销售代表每周多出一天时间专注于客户关系。

OpenAI 正式发布 AI 视频生成模型 Sora,通过水印溯源、肖像权控制、青少年保护、内容过滤等多维安全策略,在推动视频创作创新的同时,构建了负责任的 AI 应用框架。

OpenAI 发布 Sora 2,视频生成模型迎来 GPT-3.5 时刻。新模型在物理准确性、可控性上大幅提升,支持同步音效和对话,并推出基于‘角色’功能的社交 iOS 应用。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。