Skip to main content
开放网络的先行者与推动者—星融元
加入我们技术支持(Support)  TEL:(+86)4000989811

下一代数据中心网络重构:从 EVPN-VxLAN 走向端到端 SRv6 Fabric

从VxLAN到SRv6:面向AI算力时代的网络底座演进

SRv6

在过去十年的云计算演进中,EVPN-VxLAN 几乎是数据中心虚拟化与多租户网络的标准底座。它打破了传统 VLAN 4096 的隔离上限,在三层物理网络(Underlay)之上构建起无感漂移的虚拟二层网络(Overlay)。

然而,随着大模型分布式训练、高密 GPU 算力集群以及跨数据中心协同计算的爆发,网络流量特征发生了根本性变化。传统 VxLAN 架构在面对海量大象流调度、跨域协议打通以及报文封装开销时,逐渐暴露出结构性短板。基于原生 IPv6 的 SRv6(Segment Routing over IPv6)正迅速从广域网下沉至数据中心内部,有望成为新一代算力 Fabric 的核心底座。

为什么 VxLAN 在 AI 与多云时代难以为继?

在传统通用云场景下,VxLAN 很好地满足了虚拟机和容器的多租户隔离诉求。但当基础设施向异构算力和多中心协同演进时,VxLAN 的局限性越发明显:

VxLAN的局限性

1. 跨域“协议缝合”(Protocol Stitching)与网关瓶颈

在多数据中心(DCI)或混合云互联场景中,数据中心内部通常运行 EVPN-VxLAN,而广域网骨干网多采用 MPLS、SR-MPLS 或纯 IP 路由。

状态开销与单点瓶颈: 出入数据中心的边界网关(Border Leaf / DCI Gateway)必须承担复杂的协议转译与状态维护工作——解封装 VxLAN、剥离内部标签、查询路由并重新封装为 MPLS/WAN 报文。

运维割裂: DC 内部与跨域骨干网使用完全不同的 OAM 监测机制,端到端故障定界与性能遥测极为困难。

2. 算力“大象流”遭遇 ECMP 极化

AI 智算集群(如 LLM 预训练与微调)的通信模式以大跨度集合通信(AllReduce、All-to-All)为主,流量表现为流数少、突发单流吞吐大(大象流)。

  • 哈希碰撞(Hash Collision): 传统数据中心依赖等价多路径路由(ECMP)分发流量。VxLAN 依赖外层 UDP 源端口做哈希分流,少量突发大象流极易被哈希至同一条物理链路,引发局部严重拥塞。
  • PFC 风暴与 MFU 下降: 在 RoCEv2 无损网络中,链路拥塞会频繁触发 PFC(优先级流量控制)反压,严重时导致 PFC 死锁或巨量排队时延,最终拉低整个集群的算力利用率(MFU, Model FLOPs Utilization)。VxLAN 本身缺乏灵活的流量工程(TE)能力,无法根据网络拥塞实时调度路径。

3. 封装开销与芯片流水线解析代价

VXLAN vs SRv6

标准 VxLAN 引入了至少 50 字节的额外包头开销(外层 MAC + IPv4 + UDP + VxLAN Header)。在大模型梯度同步与频繁的参数小包交互中,这不仅降低了有效载荷的吞吐利用率,也对交换机 ASIC 的报文解析深度(Parsing Depth)和查表流水线造成额外负担。

新一代 SRv6 Fabric 的技术原理

SRv6

SRv6(Segment Routing over IPv6)并非简单的隧道协议,而是基于“源路由(Source Routing)”理念与原生 IPv6 扩展头构建的网络可编程指令集。

核心维度 EVPN-VxLAN 架构 下一代 SRv6 Fabric 架构
转发平面 IPv4/IPv6 Underlay + UDP 封装 + VxLAN 头部 原生 IPv6 + 路由扩展头(SRH / NEXT-CSID / REPLACE-CSID)
模块扩展性 极差(需要厂商为第三方模块适配源码)。 优秀(原生二进制模块 100% 即插即用)。
控制平面 BGP EVPN(分配 VNI / L2-L3 标签) BGP EVPN(分配 SRv6 SID,如 End.DT4/DT6)
跨域能力 依赖边界网关进行解封与标签重写 全网统一 IPv6 寻址,端到端一跳直达
流量工程 (TE) 依赖 Underlay 独立机制,Overlay 无法干预 SRv6 Policy 显式路径编排,毫秒级源路由避障
报文开销 固定 50 字节封装开销 支持C-SID压缩编码(每跳仅占 16/32-bit)

1. 统一寻址与网络指令化:Locator:Function:Args

SRv6 将网络节点与业务行为统一抽象为 128 位的 IPv6 地址(Segment ID, 简称 SID),分为三个逻辑段:

 统一寻址与网络指令化

统一寻址与网络指令化

  • Locator(定位符): 负责全网 Underlay 路由可达。普通中间节点只需按照标准 IPv6 路由(如 BGP/OSPFv3)进行最长前缀匹配转发,无需维护复杂的隧道表项。
  • Function(功能指令): 指定目的节点执行的具体网络动作。
  • End.DT4 / End.DT6:解封装并进入指定 VRF 查找 IPv4/IPv6 路由表(实现 L3 多租户隔离)。
  • End.DX2:解封装并将内层二层帧直接转发至指定出接口(实现 L2 EVPN 业务)。
  • Args(参数段): 携带流表匹配、安全标记或网络遥测元数据。

2. EVPN over SRv6:扁平化多租户承载

控制平面依然采用成熟的 BGP-EVPN,但实现机制大幅简化:

在路由发布阶段,Egress Leaf 通过 BGP Prefix-SID 属性直接向全网通告业务 SID(例如 2001:db8:1::End.DT4)。

Ingress Leaf 收到租户数据后,直接将对应的 IPv6 SID 作为目的 IP 封装外层报文。报文在 Fabric 内部透明转发,无需在 Spine 节点上维护任何租户隔离状态。

EVPN over SRv6

3. SRv6 Policy 与智能源路由调度

针对 AI 算力集群中 RoCEv2 的大象流调度痛点,SRv6 提供了确定性的流量编排手段:

  • 显式路径指定: Ingress Leaf 或集中式控制器根据链路实时遥测(Telemetry)状态,在报文中压入一组经过无拥塞链路的 SID 列表(Segment List)。
  • 零状态中间转发: 中间 Spine 和交换节点只需机械地读取当前 SID 转发并执行指针偏移(Segments Left 减 1),完全不需要在核心交换机上配置和下发细颗粒度的流表。

 SRv6 Policy

4. SID 压缩技术:根治 MTU 损耗

SID 压缩技术

为解决标准 128-bit SRH 头过长导致的报文膨胀问题,RFC9800标准化了NEXT-C-SID和REPLACE-C-SID两种压缩机制。通过将多个节点的短操作码(如 16-bit 或 32-bit)打包在同一个 128-bit IPv6 目的地址中,显著压缩了报文开销,兼顾了传统短包吞吐率与 ASIC 硬件查表性能。

SRv6在数据中心的典型应用

1. 面向AI后端网络的SRv6应用——MRC架构

由OpenAI、微软、英伟达、AMD、英特尔和博通开发的MRC架构(Resilient AI Supercomputer Networking using MRC and SRv6)就是一个很好的例子。

SRv6的一个核心原则是让应用程序控制其网络体验。在传输层实现MRC可以创建一个可编程网络,其中传输栈为每个数据包选择路径。通过在许多无状态的路径和平面上分发数据包,MRC避免了传统基于ECMP部署中常见的因流量低熵值导致的流冲突问题。这是应用定义网络的实际应用,由SRv6引入的可编程性使能。

MRC架构

2. SRv6容器网络(Container Network)——NetPila方案

阿里云的NetPila展示了SRv6如何将容器网络提升到超越VXLAN隧道的水平——通过将租户和接口标识直接嵌入IPv6/SRv6地址模型,实现了Pod之间无需隧道的直接连接,并显著增强了端点与网络的集成紧密度。

NetPila方案

3. 基于SRv6的骨干/跨数据中心网络——eCore架构

阿里云的 eCore 是一个基于 IPv6/SRv6 的骨干/跨数据中心网络架构,通过统一的 IPv6 Underlay 和 SRv6 Traffic Engineering,将路径选择从传统的网络逐跳决策转变为可编程的端到端路径控制。

在 AI 场景中,eCore 进一步结合端网协同:服务器侧根据业务类型、QoS 等信息选择 Flow Label,由网络侧将 Flow Label 映射到不同的 SRv6 SID-List,从而实现 RDMA、高带宽、低成本等不同路径的精细化选择。

eCore架构

4. SRv6数据中心前端网络

SRv6数据中心前端网络

  • 彻底消除 DCI 性能瓶颈与协议断层:去除了 DCI 上的 EVPN-to-MPLS 复杂转换逻辑,DCI 降级为大容量普通 IPv6 路由器,消除多厂商在 DCI 互通时的协议兼容难题。
  • NFV 实例与服务链极简编排:云网关、防火墙等 NFV 实例天然运行在通用 Linux/x86 宿主机上,原生支持 IPv6/SRv6 内核处理,服务链引流由硬编码转向灵活的指令序列编排。
  • 业务下发与运维极度收敛:从“DC + DCI + WAN”三段式独立规划,转变为以业务为中心的端到端扁平化 L3VPN 架构。

SRv6数据中心前端网络

5. SRv6服务链(Service Chaining)

SRv6服务链(Service Chaining)

  • 将“服务”本身变成SID

这是最大的差异。在VXLAN网络中,服务节点(如防火墙)是拓扑中的一个“黑洞”,流量需要通过复杂的路由策略“扔”进去。而在SRv6中,每个服务节点或其特定接口都被分配了一个全球唯一的SID,服务链本质上就是将一个包含多个服务SID的Segment List附加在报文上,由网络自动完成编排。

  • 统一控制面与转发面

VXLAN Overlay网络通常需要独立的控制面(如EVPN),服务链策略也依赖于控制器下发。SRv6则实现了控制面(IGP/BGP扩展通告SID)和转发面(SID封装)的统一,简化了协议栈,使得网络能更自主地执行服务链策略。

  • “无状态”的服务链

传统服务链(如通过VRF手拉手)往往需要在服务节点上维护大量状态信息。SRv6的服务链是“无状态”的,路径和服务顺序完全由报文头中的SID列表决定,服务节点只需基于当前SID进行简单转发,无需维护每个流的状态,这大大简化了服务节点(尤其是第三方设备)的设计。

AsterNOS SRv6规格与路线图

为了实现上述端到端 SRv6 Fabric 的演进,星融元 AsterNOS 制定了清晰的 SRv6 特性演进路线图。目前,AsterNOS 已完整支持传统的 SRv6 和 REPLACE-C-SID 压缩,并计划于 2026Q4 全面支持 NEXT-C-SID (uSID),帮助企业构建面向 AI 算力时代的极简扁平化网络。

分类 子项 特性 支持
SRv6 端点行为 End Endpoint
End.X Endpoint with L3 cross-connect (L3VPN)
End.DT4 Endpoint with decapsulation and IPv4 table lookup (L3VPN)
End.DT6 Endpoint with decapsulation and IPv6 table lookup (L3VPN)
End.DT46 Endpoint with decapsulation and IP table lookup (L3VPN)
End.DX4 Endpoint with decapsulation and IPv4 cross-connect (L3VPN) Q4
End.DX6 Endpoint with decapsulation and IPv6 cross-connect (L3VPN) Q4
End.DX2 Endpoint with decapsulation and L2 cross-connect (L2VPN)
End.DT2M Endpoint with decapsulation and L2 broadcast (L2VPN)
End.DT2U Endpoint with decapsulation and L2 unicast FDB lookup (L2VPN)
SID压缩 uSID uSID (NEXT-CSID) compression Q4
G-SID G-SID (REPLACE-CScID) compression, 12 slots
封装模式 H.Insert.Red Insert SRH in IPv6 with reduced encapsulation Q4
H.Encaps.Red Encaps SR headend with reduced encapsulation
H.Encaps.L2.Red Encaps SR headend over L2 layer with reduced encapsulation Q4
节点Flavors USD Ultimate Segment Decapsulation
COC G-SID mode, update DIP using compressed G-SID
IGP路由协议 ISIS ISIS for SRv6
ISIS FRR Ti-LFA high availability
OSPF OSPF for SRv6 Q4
OSPF FRR Ti-LFA high availability Q4
BGP BGP BGP for SRv6
SRv6-BE L3VPN L3VPN over SRv6-BE
EVPN L2VPN VPLS (Type 1,2,3,4) Q3
VPWS (Type 1,4) Q3
CCC Q3
Multi-homing Q3
EVPN L3VPN Type 5 (IP Prefix Route)
SRv6-TE Static TE Policy Static SRv6 TE Policy
TE Policy Dynamic SRv6 TE Policy Q4
L3VPN L3VPN over SRv6-TE
EVPN L2VPN VPLS/VPWS/CCC/Multi-homing over SRv6-TE Q3/Q4
EVPN L3VPN EVPN L3VPN (Type 1-5) over SRv6-TE
Telemetry Telemetry Collect data from switch remotely
BGP-EPE BGP-EPE Allocate SID for BGP peer
BGP-LS SRv6 SID NLRI SRv6 SID Information / Endpoint Behavior / BGP Peer Node SID TLV Q4
Node NLRI SRv6 Capabilities / Node MSD Types TLV Q4
Link NLRI SRv6 End.X / LAN End.X / Link MSD Types TLV Q4
Prefix NLRI SRv6 SID Structure / Locator TLV Q4
PCEP PCEP for SRv6 path-setup-type / capabilities / RRO / ERO subobject TLV Q4
SBFD SBFD Seamless BFD Q4
SRv6 OAM SRv6 OAM Checking reachability to destination SID or PW Q4
Flex-Algo SRv6 Flex-Algo Custom IGP route calculation algorithms Q4
OAM工具 SID Ping SID reachability pinge Q4
SID Tracert SID path trace Q4
TE Policy Ping TE Policy reachability ping Q4
TE Policy Tracert TE Policy path trace Q4
TWAMP TWAMP Two-Way Active Measurement Protocol

【参考文档】

MRC (Resilient AI Supercomputer Networking):

NetPila (阿里云 SRv6 容器网络) : https://datatracker.ietf.org/meeting/125/materials/slides-125-srv6ops-21-ipv6srv6-powering-alibaba-cloud-ai-computing-alibaba-02

eCore (阿里云 SRv6 骨干网):https://www.segment-routing.net/images/OCP-summit25-eCore_Alibaba.pdf


产品型号:数据中心交换机
功能特性:RoCEv2, PFC, ECN, DCBX ……
应用场景:GPU算力集群,数据中心,分布式存储
最后更新:2026-05-26


相关文章

星融元数据技术有限公司是领先的开放网络解决方案提供商,产品包括网络操作系统、数据中心交换机、AI智算交换机、园区交换机、开放式企业级路由和新一代网络可视化产品等。为行业企业、数据中心和云运营商提供基于通用解耦硬件和 SONiC 软件框架的全场景交钥匙网络解决方案,帮助用户构建AI时代中立、透明,易于运维、高性价比的基础网络。

🔺关注 @星融元Asterfusion 微信公众号 WeChat QR Code

对星融元产品感兴趣?

立即联系!

返回顶部

© 星融元数据技术(苏州)有限公司 苏ICP备17070048号-2