Skip to main content
开放网络的先行者与推动者—星融元
加入我们技术支持(Support)  TEL:(+86)4000989811

白皮书:AI智算双平面网络方案

前言

由于LLM与传统云计算存在显著差异,传统数据中心网络并不适用于LLM训练场景。LLM训练中的流量模型以大象流为主导,使得ECMP算法容易出现哈希极化现象,导致流量分布不均等问题,采用双平面架构设计可以有效避免哈希极化问题。同时LLM训练需要GPU同步完成迭代运算,这使其对单点故障极为敏感,双平面架构使用网卡双上联设计,容错性强,单个Leaf或链路故障不中断训练。
本文聚焦AI智算GPU后端双平面网络设计,以星融元数据中心400G/800G高密度接口交换机为核心硬件载体,采用Clos组网,基于Rail-optimized架构,提供标准化部署的解决方案。

读者对象

本手册主要适用于方案规划设计及现场实施人员,相关人员应具备以下能力:

  • 熟悉Asterfusion数据中心网络交换机产品
  • 了解EVPN Multi-Homing、RoCE等技术

修改记录

日期版本修改备注
2026-4-29V1.0首次发布

1 概述

随着人工智能技术的快速发展,大规模语言模型(LLM)训练已成为数据中心网络面临的新挑战。与传统云计算应用相比,LLM训练呈现出显著不同的流量特征和技术需求:

AI智算网络的演进与挑战

  • 规模爆炸式增长:从千卡到万卡乃至更大规模,GPU集群规模呈指数级增长
  • 流量模式变革:以All-Reduce、All-Gather等集合通信操作为主导的大象流成为主要流量特征
  • 性能要求极致:纳秒级时延、零丢包率、高吞吐量成为AI训练的硬性要求
  • 可靠性压力剧增:单点故障可能导致数万GPU计算资源的浪费和训练任务中断

传统数据中心网络的收敛设计在高密度AI流量下容易引发拥塞和丢包,严重影响训练效率,采用双平面架构设计可以有效解决上述挑战:

  • 避免哈希极化:通过物理隔离的独立转发平面,从根本上消除ECMP哈希冲突
  • 提升容错能力:使用网卡双上联设计,单个Leaf或链路故障不中断训练
  • 保障训练连续性:LLM训练需要GPU同步完成迭代运算,这使其对单点故障极为敏感,双平面架构提供了天然的冗余保护

2 AI智算双平面网络架构

2.1 Rail-Only和Rail-Optimized架构

连接到不同服务器同编号GPU的Leaf节点,被定义为一个Rail(轨道)平面,即Rail N通过第N台Leaf交换机实现所有N号GPU的互联。如下图,每台服务器上的GPU编号为0~7,对应Rail 1~Rail 8。同轨传输是指源GPU与目标GPU的对应网卡接入到同一台Leaf交换机。LLM(Large Language Model)训练通过混合并行(数据并行、张量并行、流水线并行)策略优化流量分布,使得大部分流量集中在节点内和同轨道内。

Rail-only架构
图 1 Rail-only架构

Rail-only架构采用单层组网设计,将整个集群的网络在物理上划分为8个独立的轨道,不同节点的GPU间通信均为同轨传输,轨道内通信可实现“一跳直达”。

在Rail概念的基础上,把由一组Rail组成的基础构建单元视作一个Group,其中包含若干台Leaf交换机与GPU服务器。当集群规模扩大时,可通过水平堆叠多个Group来扩展,从而支撑更大规模的集群部署。
可将计算网想象成一套铁路系统:计算节点是装载算力的“车站”,Rail是连接各站同号GPU的“专属铁路线”保障高速直达;Group则是整合多条轨道及其配套交换机的“标准站台区”单元。通过这种模组化的堆叠,智算中心能像搭积木一样横向扩展,既保证了单条轨道内的极速通信,又实现了万卡集群的高效互联。

Rail-optimized架构
图2 Rail-optimized架构

如上图,Rail-optimized(轨道优化)架构的核心设计思路是将每台服务器的同号网卡接入同一台Leaf交换机,确保GPU间的多机通信尽可能经过最少跳数内完成。在这种设计下,GPU节点间的通信可利用自身的NVSwitch[1]内部通路,只需要经过一跳即可到达,而无需跨多台交换机,避免产生额外时延。具体如下:

  • 服务器内互联:8张GPU通过NVLink总线连接至NVSwitch,实现服务器内部GPU间的低时延通信,降低Scale-Out网络传输压力;
  • 服务器-网络互联:所有服务器遵循统一的连线逻辑,网卡按“NIC1-Leaf1、NIC2-Leaf2……”的规则,分别接入多台Leaf交换机;
  • 网络层互联:Leaf与Spine交换机采用全互联模式,采用2层Clos架构。

2.2 双平面架构

双平面是一种创新的网络架构,通过构建两个完全相同的网络平面来优化大规模GPU集群的互联。每个GPU都对应两个网卡端口,两个端口分别连接不同的网络平面,如图3所示。这两个网络平面的拓扑结构完全相同,且没有任何交叉连接。这种设计大幅降低了哈希极化的概率,优化了通信效率。双平面架构不仅提升了网络性能,还增强了网络的稳定性和可靠性,即使单一设备或单一平面出现网络故障,也不会影响整个集群网络的正常运行。

双平面Rail-optimized架构
图3 双平面Rail-optimized架构

双平面架构将网络划分为两个完全独立的转发平面(Plane 1和Plane 2),每个平面包含完整的Clos架构层次,两个平面在物理上完全隔离,确保转发平面的独立性和故障隔离。

对比维度传统单平面架构双平面架构
哈希冲突哈希极化严重自然分流,流量分布均匀
故障影响全网影响平面隔离
扩展性线性扩展受限平面级扩展支持更大规模
确定性路径多变确定性差路径固定性能可预测
表格 1 双平面架构与传统架构对比

3 支撑双平面网络的技术

3.1 双平面技术

在双平面网络架构中,每张网卡都需要出两个端口同时连接两台Leaf,形成类似双上联Leaf堆叠的效果。在传统数据中心网络中,通常使用MC-LAG(Multi Chassis Link Aggregation Group,跨设备链路聚合组)来实现堆叠式双Leaf架构。在堆叠式双Leaf架构中,两个Leaf通过直连链路相连,这种设计对同步ARP、MAC等数据平面转发信息至关重要。这种方案能显著降低生产环境中因独立Leaf交换机故障导致的系统性能下降问题,但由于两个Leaf之间直连链路还需要负责故障情况下的业务转发,所以会占用交换机的大量带宽。星融元提供的双平面网络架构方案有两种实现双Leaf架构的方式可供按需选择,一种依赖网卡双发ARP的能力,一种依赖交换机具备EVPN MH(EVPN Multi-Homing,EVPN多宿主)的能力。

3.1.1 双上联Leaf网卡双发

该实现的核心是移除两台Leaf之间的物理直连链路 ,转而通过端侧网卡和交换机的协同来实现类似堆叠的高可用效果。在此实现中,服务器的网卡采用bond模式双上行,分别连接到两个平面的Leaf交换机。这两台Leaf交换机不进行物理堆叠,也没有专用的直连同步链路。

其关键技术点在于如何在没有直连链路的情况下,确保两台Leaf对服务器的ARP请求和MAC地址学习保持一致,从而实现流量的无缝切换。主要通过以下几个方面实现:

网卡双发ARP:这是方案的核心依赖。服务器网卡需要具备向两个上行端口同时发送ARP请求的能力。这样,两台Leaf交换机都能学习到服务器的MAC地址和IP地址。

交换机ARP代理与ARP转主机路由:Leaf交换机开启ARP代理功能,并将学习到的ARP表项转换为32位的主机路由(ARP-to-Host Route),通过上行的BGP协议宣告给整个平面。

这样,不同平面的交换机网络都能获得完整的服务器网卡Host路由。

双上联Leaf网卡双发技术
图 4 双上联Leaf网卡双发技术

3.1.2 双上联Leaf EVPN MH

EVPN MH是一种多归多活VXLAN网关方案,在RFC 7432中定义,使用BGP EVPN作为控制平面。与MC-LAG方案类似,EVPN MH方案提供了接入场景下高可靠的支持,实现了负载均衡、故障容错等功能。相比现有的MC-LAG方案,EVPN MH方案按照RFC标准实现,具备良好的兼容性。同时,无需部署多活设备之间的物理连线,便于扩展。

在此实现中,两台Leaf交换机作为EVPN的PE设备,通过管理网或者交换机AUX 10G链路(非业务端口)直连建立BGP-EVPN协议连接,共同服务于同一组GPU服务器。其核心是通过ESI(Ethernet Segment Identifier,以太网段标识符)来标识服务器连接的两个物理链路,从而实现对同一以太网段的多归属接入。

其工作原理示意图如下,服务器网卡发送ARP广播通过bond负载均衡之后发往其中一个平面的Leaf设备,Leaf设备通过向VXLAN隧道泛洪ARP广播使得隧道另一端的Leaf(不同平面)同步学习到了ARP,然后两台不同平面的Leaf将学习到的ARP表项转换为32位的主机路由(ARP-to-Host Route),通过上行的BGP协议宣告给整个平面。

双上联Leaf EVPN MH技术
图 5 双上联Leaf EVPN MH技术

3.2 负载均衡技术

ECMP(Equal-Cost Multi-Path,等价多路径)逐流负载均衡,是数据中心网络中应用最广泛的选路策略。通过对数据包的固定字段(如源/目的MAC地址、IP五元组等)作为哈希因子,利用哈希算法生成哈希值,在多条路径中随机选路。这种基于数据包的特征字段的负载均衡方式也称为静态负载均衡。

然而,逐流负载均衡在流量特征单一时易引发负载分担不均,尤其当“大象流”出现时,会加剧所选中成员链路的拥塞,严重影响网络性能,甚至引起丢包。深度学习模型高度依赖于All-Reduce、All-Gather、Broadcast等集合通信操作,这类操作会在各GPU间产生密集流量交互,传输速率通常高达每秒数太比特(Tbps)。同时,大模型参数同步依赖的集合通信存在木桶效应——若流量分布不均,即使只有一条路径发生拥塞,也可能拖慢整个训练任务的进度,放大负面影响。因此,传统逐流负载均衡方式并不适用于AI智算网络。

针对这一问题,本文介绍三种替代传统逐流负载分担的技术方案:基于子流(Flowlet)的负载均衡技术、智能选路技术,以及包喷洒技术。

3.2.1 自适应路由切换

ARS(Adaptive Routing and Switching,自适应路由切换)是一种基于Flowlet(子流)的负载均衡技术。其借助ASIC提供的硬件ALB(Auto-Load-Balancing)[2]能力,能够在减少乱序的同时实现近乎逐包负载分担的均衡性。该技术通过将哈希值相同的数据流按一定时间间隔分割成一系列Flowlet,再通过实时感知端口的带宽利用率、队列深度等链路质量指标,将Flowlet主动分配至空闲路径,从而提升整体网络带宽利用率。

3.2.2 智能选路

智能选路技术根据负载均衡实现的方式分为动态和静态两种。

动态智能选路是一种基于感知路由的负载均衡技术,综合评估带宽使用、队列占用、转发时延等关键参数,精准判断网络路径质量。其中,带宽和队列使用基于ASIC硬件寄存器统计,精度达百毫秒级;转发时延基于INT(In-band Network Telemetry,带内网络遥测)技术,精度达纳秒级。各交换机实时检测路径质量,通过BGP扩展属性传递信息,并结合逐流的动态WCMP(Weighted Cost Multipath,加权多路径),将流量动态分配至最佳路径,避免网络瓶颈,提升带宽利用率。

静态智能选路是一种基于预设策略的负载均衡技术,将GPU发往Leaf不同下行接口的流量通过业务隔离与定向转发,结合PBR(Policy-Based Routing,策略路由)将流量重定向至指定的Leaf上行接口,从而进入预设的Spine设备,实现1:1收敛下的上行负载均衡。该技术将特定流量与物理路径强绑定,适用于对路径稳定性要求较高、流量模型相对固定的场景。

3.2.3 包喷洒

包喷洒[3]是一种逐包负载均衡技术,通过将数据包均匀喷洒到各条链路上,避免单一路径拥堵。包喷洒技术包含两种算法:

  • Random算法:将数据包随机分散至各条链路;
  • Round Robin算法:按顺序将数据包逐一、等量地分散至各条链路。

尽管逐包负载均衡在理论上能实现网络利用率最大化,但也面临显著挑战——实际组网中,当数据包通过不同链路能到达目的地时,由于各链路的转发时延不同,造成接收端报文出现乱序,影响整体性能。因此,逐包负载均衡技术需要硬件层面的强力支持,即端侧高性能网卡需具备乱序重排能力。

4 搭建400G AI智算双平面网络

4.1 集群组网设计

4.1.1 组网方案

中大规模400G AI智算双平面网络组网
图 6 中大规模400G AI智算双平面网络组网

上图为一个256计算节点(2048个GPU)的400G AI智算双平面Rail-optimized架构组网图,部署48台CX864E-N(16台Spine节点,32台Leaf节点),包含两个平面,每个平面16台Leaf节点和8台Spine节点。其核心设计原则如下:

  • 每个GPU连接专用400G网卡,每个400G网卡出两个端口分别连接两个平面,每台服务器的网卡所出的第一个端口按照“NIC1-Leaf1、NIC2-Leaf2……”的规则接入Plane 1的Leaf交换机,每台服务器的网卡所出的第二个端口按照“NIC1-Leaf1、NIC2-Leaf2……”的规则接入Plane 2的Leaf交换机。
  • 每个平面网络采用2层Clos架构,平面内Spine与Leaf全互联,利用IPv6 link-local特性建立unnumbered BGP邻居,宣告各Rail的网段路由,实现路由交换,无需为Leaf-Spine互联接口规划IP地址;
  • Leaf下行与上行容量的比值应严格遵循1:1收敛比,保证无阻塞传输;
  • Leaf、Spine交换机启用一键RoCE及负载均衡特性,构建无损网络。

4.1.2 设备选型

建设中大规模400Gbps RoCEv2网络,推荐选用星融元数据中心交换机CX864E-N、CX732Q-N,核心依托两款设备的超低转发时延特性——CX864E-N端到端转发时延低至560ns,CX732Q-N更可达500ns,可实现同轨传输约600ns超低时延,跨轨传输(Leaf-Spine-Leaf)三层转发的端到端网络时延控制在2μs以内,充分满足RoCEv2网络对低时延的严苛要求。

在双平面Rail-optimized组网中,单Group内的Leaf节点数量与每台服务器的GPU数量(即Rail数量)相关。以NVIDIA DGX H100 GPU服务器(每台搭载8个GPU)为例,一个Group需配置16个Leaf节点,对应8个Rail。

每个Group可接入的服务器最大数量与Leaf节点的接口形态相关。为保证1:1收敛比,Leaf节点的一半接口用于连接GPU服务器,另一半接口则连接Spine节点,因此每个Group最多可接入的GPU服务器为Leaf节点可用接口数量的一半。

下表分别为选用CX864E-N、CX732Q-N部署不同GPU数量双平面网络的节点配置需求:

总GPU数/服务器数Leaf节点数量Spine节点数量每台Leaf与Spine之间的400G链路数
512/648432
1024/12816816
2048/25632168
4096/51264324
8192/1024128642
16384/20482561281
表格 1 选用CX864E-N部署不同GPU数量的双平面网络所需的节点配置需求
总GPU数/服务器数Leaf节点数量Spine节点数量每台Leaf与Spine之间的400G链路数
256/321684
512/6432162
1024/12864321
表格 2 选用CX732Q-N部署不同GPU数量的双平面网络所需的节点配置需求

5 结语

随着人工智能技术的飞速发展,AI智算网络正经历着前所未有的变革。本方案系统阐述了基于双平面架构的AI智算网络设计理念和技术实现,为大规模GPU集群的网络建设提供了完整的解决方案。本方案可有效支撑不同规模的AI集群双平面计算网部署,如想了解具体配置实施案例,请参阅相关最佳实践。

[1] NVSwitch为NVIDIA推出的承载高速NVLink的交换芯片,在Scale-Up网络实现多GPU以NVLink能够达到的最高速度进行通信。
[2] [3] CX864E-N型号产品具备该能力。


产品型号: 星融元(Asterfusion)CX864E-N (64 x 800G OSFP)
功能特性:RoCEv2, PFC, ECN, DCBX ……
应用场景:GPU算力集群,分布式存储
最后更新:2026-05-18

如有其它问题,请填写需求表单联系我们。www.asterfusion.com

A-lab-AI&HPC

对星融元产品感兴趣?

立即联系!

返回顶部

© 星融元数据技术(苏州)有限公司 苏ICP备17070048号-2