2026年5月5日,OpenAI 联合 AMD、Broadcom、Intel、Microsoft、NVIDIA 等芯片与云巨头,正式发布名为 MRC(Multipath Reliable Connection,多路径可靠连接) 的全新网络协议。该协议通过开放运算计划(OCP)开源,并已部署于全球最大的 NVIDIA GB200 超级电脑中,用于训练前沿 AI 模型。
传统网络瓶颈:单点故障拖垮整个集群
训练大模型的 GPU 集群规模动辄数万甚至十万张。在传统网络架构下,只要一个数据包发生延迟或交换器故障,整个同步训练步骤就会卡住,大量 GPU 被迫闲置。过去,单链路故障往往导致训练中断、重启,或浪费大量时间等待路由重新收敛,成本极高。随着集群规模扩大,这一痛点越发致命。
OpenAI 决定从底层重新设计网络,目标是让十万级 GPU 的通信达到“几乎不受故障影响”的可靠度。
MRC 三大核心设计:多平面、自适应喷撒、静态源路由
MRC 协议通过三项底层架构创新实现超低延迟与超高容错:
- 多平面(Multi-plane)拓扑:将 800Gb/s 网络接口拆分为多个小链接(如8个100Gb/s),连接至不同交换器形成平行平面。系统仅需 2 层交换器即可连接超过 10 万个 GPU,而传统架构需要 3-4 层。这大幅降低建置成本、功耗与元件数量。
- 自适应封包喷撒(Adaptive Packet Spraying):不再让单一传输走固定路径,而是将封包分散到数百条路径上。系统动态负载平衡,探测到拥塞自动切换;若交换器过载,则启动“封包修剪(Packet Trimming)”仅转发标头以触发快速重传,减少误判。
- 静态源路由(SRv6 Source Routing):停用传统 BGP 动态路由协议,由发送端在封包中嵌入完整路径。交换器只需遵循静态转发表,消除动态故障的复杂性。当故障发生时,MRC 能在 微秒级别 绕过故障路径,训练作业几乎感觉不到中断。
已部署于全球最大 GB200 超级电脑,��用于训练下一代模型
MRC 并非纸上谈兵。OpenAI 证实,该协议已全面部署在其所有最大型的 NVIDIA GB200 超级电脑上,包括与甲骨文(Oracle Cloud)在德州 Abilene 合作的站点以及微软的 Fairwater 超级电脑中,并正用于训练多个下一代前沿大模型。OpenAI 强调:“在生产环境中,即使每分钟有多个链接发生抖动或需要重启第一层交换器,训练作业也几乎不受影响,无需特别协调维护时间。”
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

