
OpenAI联合AMD、博通、英特尔、微软和英伟达发布MRC协议,这是一种新型网络协议,通过多平面网络、自适应数据包喷洒和静态源路由,显著提升大型AI训练集群的GPU网络性能和弹性。MRC已部署在英伟达GB200超级计算机上,并通过开放计算项目向行业开放。
每周有超过9亿用户使用ChatGPT,OpenAI的系统正成为全球AI基础设施的核心。随着模型规模的指数级增长,训练这些前沿模型所需的计算资源也在急剧膨胀。在Stargate超级计算机项目启动之前,OpenAI已经与合作伙伴共同开发并维护了三代超级计算机。这些宝贵经验让团队深刻认识到:要高效利用Stargate级别的算力并成功实现使命,必须重新思考并大幅降低每一层技术栈的复杂性——网络设计首当其冲。
2026年5月5日,OpenAI正式宣布与AMD、博通(Broadcom)、英特尔(Intel)、微软(Microsoft)和英伟达(NVIDIA)联合开发了MRC(Multipath Reliable Connection,多路径可靠连接)协议。这是一个全新的网络协议,旨在提升GPU在大型训练集群中的网络性能和弹性。MRC规范已通过开放计算项目(OCP)发布,供整个行业使用和构建。
当训练大型AI模型时,单个训练步骤可能涉及数百万次数据传输。一次传输的延迟会像涟漪一样波及整个任务,导致GPU空闲等待。网络拥塞、链路和设备故障是造成传输延迟和抖动的最常见原因。
随着集群规模增大,这些问题变得更加频繁且难以解决。这使得网络技术成为Stargate设计的关键组成部分。为了达到Stargate超级计算机的当前规模,OpenAI面临两大网络挑战:
对于同步预训练——其中许多计算机上的大量GPU以锁步方式协作训练一个AI模型——这一点尤其关键。运行的任务越大,任何单个链路抖动或故障的影响就越大。这些工作负载充当了一种“故障放大器”,因此防止这种情况变得至关重要。
OpenAI的目标不仅是构建一个快速的网络,还要构建一个即使在故障情况下也能提供高度可预测性能的网络,以保持训练任务持续进行。为了实现这种可靠性,OpenAI的扩展团队与AMD、博通、英特尔、微软和英伟达在过去两年中合作开发了一种构建和运营网络的新方法。
这项努力的成果就是MRC(多路径可靠连接)技术。它是一种内置于最新800Gb/s网络接口中的新型网络协议,允许将单个传输分散到数百条路径上,在微秒级内绕过故障,并运行更简单的网络控制平面。
MRC扩展了融合以太网上的RDMA(RoCE)——这是InfiniBand贸易协会(IBTA)的标准,支持GPU和CPU之间的硬件加速远程直接内存访问。它借鉴了超以太网联盟(UEC)开发的技术,并使用基于SRv6的源路由进行扩展,以支持大规模AI网络架构。
构建高弹性网络需要从具有足够天然冗余的网络拓扑开始,这样即使网络中的链路或交换机发生故障,所有流量仍能获得良好性能。MRC没有将每个网络接口视为一个800Gb/s链路,而是将其拆分为多个较小的链路。例如,一个接口可以连接到八个不同的交换机。
然后可以构建八个独立的并行网络(或称为“平面”),每个以100Gb/s运行,而不是单个800Gb/s网络。这一改变对集群的形态产生了巨大影响。一个可以连接64个800Gb/s端口的交换机,现在可以连接512个100Gb/s端口。这使得只需两层交换机就能构建一个完全连接约131,000个GPU的网络。而传统的800Gb/s网络则需要更多层。
MRC的自适应数据包喷洒技术能够智能地将数据流分散到多个路径上,从而几乎消除了核心拥塞。传统的负载均衡方法往往无法适应动态变化的网络状况,而MRC可以实时调整数据包的传输路径,确保网络资源得到最有效的利用。
MRC的部署使用静态源路由来绕过故障,并消除整类路由故障。与传统的动态路由协议不同,静态源路由在数据包发送时就已经确定了完整路径。这种方法不仅简化了网络控制平面,还避免了因路由计算和收敛而引入的延迟和不确定性。
MRC已经部署在OpenAI所有最大的英伟达GB200超级计算机上,这些计算机用于训练前沿模型,包括位于德克萨斯州阿比林的Oracle云基础设施(OCI)站点以及微软的Fairwater超级计算机。MRC已被用于训练多个OpenAI模型,利用了英伟达和博通的硬件。
OpenAI还共同撰写了一篇详细描述经验的论文:“使用MRC和SRv6的弹性AI超级计算机网络”(Resilient AI Supercomputer Networking using MRC and SRv6)。
发布MRC规范是OpenAI整体计算战略的一部分:在关键基础设施层共享标准,有助于更高效、更可靠地扩展AI系统,并在更广泛的合作伙伴生态系统中推广。
通过将MRC贡献给开放计算项目(OCP),OpenAI使整个行业都能利用这项技术。这不仅加速了AI模型的训练过程,还降低了构建和维护大规模AI计算集群的门槛。对于任何正在构建或计划构建大型AI训练基础设施的组织来说,MRC提供了一种经过验证的方法来应对网络挑战。
随着AI模型不断向更大规模演进,网络技术的重要性日益凸显。MRC协议的出现标志着AI训练网络设计的一个重要里程碑。通过多平面网络、自适应数据包喷洒和静态源路由的有机结合,MRC为超大规模AI训练提供了前所未有的性能和可靠性。
OpenAI与AMD、博通、英特尔、微软和英伟达的合作表明,解决AI基础设施挑战需要整个生态系统的共同努力。随着MRC规范的开放和推广,我们可以期待看到更多创新应用和优化,最终推动AI技术向更高层次发展。
对于关注OpenAI新闻的读者来说,MRC的发布不仅是一项技术突破,更是AI基础设施演进方向的重要信号。在追求更强大AI模型的旅程中,网络创新将继续扮演关键角色。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

OpenAI销售团队规模一年增长三倍,通过构建GTM Assistant智能助手,将顶尖销售经验系统化,实现销售生产力提升20%,让销售代表每周多出一天时间专注于客户关系。

OpenAI 正式发布 AI 视频生成模型 Sora,通过水印溯源、肖像权控制、青少年保护、内容过滤等多维安全策略,在推动视频创作创新的同时,构建了负责任的 AI 应用框架。

OpenAI 发布 Sora 2,视频生成模型迎来 GPT-3.5 时刻。新模型在物理准确性、可控性上大幅提升,支持同步音效和对话,并推出基于‘角色’功能的社交 iOS 应用。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。