构建万卡AI集群:一文掌握双平面大规模集群组网最佳实践

随着AI大模型参数量的迅速增长,智算中心的网络架构面临极大的挑战。为了支撑万卡GPU集群的高效运行,双平面组网方案正逐渐成为解决传统网络痛点的关键路径。本文将基于行业领先的架构实践,探讨如何利用双平面技术打造高可用、高吞吐的AI算力底座。

AI大模型训练,为何传统网络“不堪重负”?

在传统云计算时代游刃有余的网络协议,面对AI训练流量时却显力不从心了。

大象流冲击下的ECMP失效

大语言模型的训练流量多为“大象流”(链接),单流往往能瞬间占满网卡带宽。传统的等价多路径路由(ECMP)基于五元组进行哈希,面对数量少但体积巨大的AI数据流,很难实现有效的负载分担,导致链路利用率极低。

哈希极化与高昂的故障成本

在三层Clos架构中,流量经过多次哈希极易产生“哈希极化”,导致多条链路流量叠加到同一出口,引发严重拥塞。另外,AI训练要求极高的同步性(All-Reduce),Leaf节点的单点故障可能导致数百台GPU服务器停摆。据阿里公开数据,单次故障的恢复成本高达数万美元,是传统云业务的20倍。

HPN双平面架构的标杆实践

作为双平面技术的提出者,阿里HPN为我们提供了极具参考价值的落地范本。其核心在于用两层Spine-Leaf架构替代三层架构,并通过创新解决上述问题。

HPN架构概览与双平面核心设计

非堆叠双ToR接入

非堆叠方案高可用机制

在智算场景之前,数据中心要实现服务器双归到两台ToR,标准方案是MC-LAG(跨设备链路聚合),两台ToR之间的横连线(VSL/peer-link),跑私有堆叠协议,逻辑上伪装成“一台交换机”,和服务器建立LACP聚合。但这种方案在智算场景有三个致命缺陷:

  1. 浪费珍贵端口:横连线至少要占用2-4个400G/800G端口,相当于少接4-8台GPU服务器,而智算网络端口就是算力,浪费不起
  2. 控制面易不同步:堆叠协议的控制面状态和ASIC转发表在链路闪断、软件升级时可能不一致,容易出现流量黑洞,RDMA场景下触发训练中断;
  3. 故障域反而扩大:一旦横连线抖动,两台ToR可能触发双主保护,直接把整组接入端口关掉,比单点故障影响更大;

通过定制化的LACP协议,协商相同MAC和关闭Actor Port ID校验,支持无横连的双归协商;网卡支持ARP转路由技术,服务器同一个IP从两个物理口同时发ARP,两台ToR都学到ARP后转成/32主机路由,通过BGP宣告到全网,最终实现了两台ToR设备的无缝切换。

物理隔离根除哈希极化

物理隔离消除极化

通过将ToR交换机划分到完全物理隔离的两个平面(Plane 1和Plane 2),从源头避免了汇聚层的哈希冲突。一张网卡发出的两条流分别进入不同平面,永不交汇,彻底根治了极化问题。

整网大规模部署的RePaC(轻量级相对路径控制方案,通过离线收集路径映射表和在线调整数据包头部偏移量,实现确定性路径控制),主机可直接获取每个交换机中精确的哈希结果以及确保所有主机保持最新链路状态并计算正确的不相交路径。

端口拆分与规模倍增

双平面设计- 规模倍增

通过将400G物理端口拆分为两个200G逻辑端口,配合双平面设计,单Pod的GPU规模从传统的8K提升至15K,若全端口拆分,两层架构即可支持32K GPU。同号GPU网卡接入同一ToR组,跨机通信优先走NVLink intra-host,单主机3.2Tbps分散至16台ToR,段内GPU规模达1K。

突破壁垒:构建普适性的双平面解决方案

尽管阿里方案已经解决了AI大模型训练网络面临的难题,但它高度依赖定制化LACP协议、网卡的ARP能力及私有路径算法,在通用市场推广非常困难。针对这一现状,我们提出了一套基于标准协议的双平面方案。

如何让标准交换机支持双归接入?

实测表明,基于SONiC自研网络操作系统(如AsterNOS),无需定制LACP,仅需配置相同的虚拟MAC地址,即可天然支持双上行链路的聚合。当前AsterNOS实现的LACP不强制要求Port ID检查,所以无需定制化天然支持非堆叠聚合。

无需定制化LACP

ARP双发难题的标准化解法

  • 网卡具备ARP双发能力:服务器网卡需要具备向两个上行端口同时发送ARP请求的能力。这样,两台Leaf交换机都能学习到服务器的MAC地址和IP地址。Leaf交换机开启ARP代理功能,并将学习到的ARP表项转换为32位的主机路由(ARP-to-Host Route),通过上行的BGP协议宣告给整个平面。

双上联Leaf网卡双发技术

负载均衡:从私有算法到自适应路由

放弃私有的全局路径计算算法,转而采用基于子流(Flowlet)的负载均衡技术、智能选路技术,以及包喷洒技术来替代传统追流负载分担的技术方案。

  • 自适应路由切换

ARS(Adaptive Routing and Switching,自适应路由切换)是一种基于Flowlet(子流)的负载均衡技术。其借助ASIC提供的硬件ALB(Auto-Load-Balancing)([[1]])能力,能够在减少乱序的同时实现近乎逐包负载分担的均衡性。该技术通过将哈希值相同的数据流按一定时间间隔分割成一系列Flowlet,再通过实时感知端口的带宽利用率、队列深度等链路质量指标,将Flowlet主动分配至空闲路径,从而提升整体网络带宽利用率。

  • 智能选路(动态智能选路)

动态智能选路是一种基于感知路由的负载均衡技术,综合评估带宽使用、队列占用、转发时延等关键参数,精准判断网络路径质量。其中,带宽和队列使用基于ASIC硬件寄存器统计,精度达百毫秒级;转发时延基于INT(In-band Network Telemetry,带内网络遥测)技术,精度达纳秒级。各交换机实时检测路径质量,通过BGP扩展属性传递信息,并结合逐流的动态WCMP(Weighted Cost Multipath,加权多路径),将流量动态分配至最佳路径,避免网络瓶颈,提升带宽利用率。

  • 包喷洒

包喷洒是一种逐包负载均衡技术,通过将数据包均匀喷洒到各条链路上,避免单一路径拥堵。包喷洒技术包含两种算法:

  1. Random算法:将数据包随机分散至各条链路;
  2. Round Robin算法:按顺序将数据包逐一、等量地分散至各条链路。

尽管逐包负载均衡在理论上能实现网络利用率最大化,但也面临显著挑战——实际组网中,当数据包通过不同链路能到达目的地时,由于各链路的转发时延不同,造成接收端报文出现乱序,影响整体性能。因此,逐包负载均衡技术需要硬件层面的强力支持,即端侧高性能网卡需具备乱序重排能力。

集群组网设计

中大规模400G AI智算双平面网络组网

上图为一个256计算节点(2048个GPU)的400G AI智算双平面Rail-optimized架构组网图,部署48台CX864E-N(16台Spine节点,32台Leaf节点),包含两个平面,每个平面16台Leaf节点和8台Spine节点。其核心设计原则如下:

  • 每个GPU连接专用400G网卡,每个400G网卡出两个端口分别连接两个平面,每台服务器的网卡所出的第一个端口按照“NIC1-Leaf1、NIC2-Leaf2……”的规则接入Plane 1的Leaf交换机,每台服务器的网卡所出的第二个端口按照“NIC1-Leaf1、NIC2-Leaf2……”的规则接入Plane 2的Leaf交换机。
  • 每个平面网络采用2层Clos架构,平面内Spine与Leaf全互联,利用IPv6 link-local特性建立unnumbered BGP邻居,宣告各Rail的网段路由,实现路由交换,无需为Leaf-Spine互联接口规划IP地址;
  • Leaf下行与上行容量的比值应严格遵循1:1收敛比,保证无阻塞传输;
  • Leaf、Spine交换机启用一键RoCE及负载均衡特性,构建无损网络。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值