下一代数据中心网络重构:从 EVPN-VxLAN 走向端到端 SRv6 Fabric
从VxLAN到SRv6:面向AI算力时代的网络底座演进
在过去十年的云计算演进中,EVPN-VxLAN 几乎是数据中心虚拟化与多租户网络的标准底座。它打破了传统 VLAN 4096 的隔离上限,在三层物理网络(Underlay)之上构建起无感漂移的虚拟二层网络(Overlay)。
然而,随着大模型分布式训练、高密 GPU 算力集群以及跨数据中心协同计算的爆发,网络流量特征发生了根本性变化。传统 VxLAN 架构在面对海量大象流调度、跨域协议打通以及报文封装开销时,逐渐暴露出结构性短板。基于原生 IPv6 的 SRv6(Segment Routing over IPv6)正迅速从广域网下沉至数据中心内部,有望成为新一代算力 Fabric 的核心底座。
为什么 VxLAN 在 AI 与多云时代难以为继?
在传统通用云场景下,VxLAN 很好地满足了虚拟机和容器的多租户隔离诉求。但当基础设施向异构算力和多中心协同演进时,VxLAN 的局限性越发明显:
1. 跨域“协议缝合”(Protocol Stitching)与网关瓶颈
在多数据中心(DCI)或混合云互联场景中,数据中心内部通常运行 EVPN-VxLAN,而广域网骨干网多采用 MPLS、SR-MPLS 或纯 IP 路由。
状态开销与单点瓶颈: 出入数据中心的边界网关(Border Leaf / DCI Gateway)必须承担复杂的协议转译与状态维护工作——解封装 VxLAN、剥离内部标签、查询路由并重新封装为 MPLS/WAN 报文。
运维割裂: DC 内部与跨域骨干网使用完全不同的 OAM 监测机制,端到端故障定界与性能遥测极为困难。
2. 算力“大象流”遭遇 ECMP 极化
AI 智算集群(如 LLM 预训练与微调)的通信模式以大跨度集合通信(AllReduce、All-to-All)为主,流量表现为流数少、突发单流吞吐大(大象流)。
- 哈希碰撞(Hash Collision): 传统数据中心依赖等价多路径路由(ECMP)分发流量。VxLAN 依赖外层 UDP 源端口做哈希分流,少量突发大象流极易被哈希至同一条物理链路,引发局部严重拥塞。
- PFC 风暴与 MFU 下降: 在 RoCEv2 无损网络中,链路拥塞会频繁触发 PFC(优先级流量控制)反压,严重时导致 PFC 死锁或巨量排队时延,最终拉低整个集群的算力利用率(MFU, Model FLOPs Utilization)。VxLAN 本身缺乏灵活的流量工程(TE)能力,无法根据网络拥塞实时调度路径。
3. 封装开销与芯片流水线解析代价
标准 VxLAN 引入了至少 50 字节的额外包头开销(外层 MAC + IPv4 + UDP + VxLAN Header)。在大模型梯度同步与频繁的参数小包交互中,这不仅降低了有效载荷的吞吐利用率,也对交换机 ASIC 的报文解析深度(Parsing Depth)和查表流水线造成额外负担。
新一代 SRv6 Fabric 的技术原理
SRv6(Segment Routing over IPv6)并非简单的隧道协议,而是基于“源路由(Source Routing)”理念与原生 IPv6 扩展头构建的网络可编程指令集。
| 核心维度 | EVPN-VxLAN 架构 | 下一代 SRv6 Fabric 架构 |
| 转发平面 | IPv4/IPv6 Underlay + UDP 封装 + VxLAN 头部 | 原生 IPv6 + 路由扩展头(SRH / NEXT-CSID / REPLACE-CSID) |
| 模块扩展性 | 极差(需要厂商为第三方模块适配源码)。 | 优秀(原生二进制模块 100% 即插即用)。 |
| 控制平面 | BGP EVPN(分配 VNI / L2-L3 标签) | BGP EVPN(分配 SRv6 SID,如 End.DT4/DT6) |
| 跨域能力 | 依赖边界网关进行解封与标签重写 | 全网统一 IPv6 寻址,端到端一跳直达 |
| 流量工程 (TE) | 依赖 Underlay 独立机制,Overlay 无法干预 | SRv6 Policy 显式路径编排,毫秒级源路由避障 |
| 报文开销 | 固定 50 字节封装开销 | 支持C-SID压缩编码(每跳仅占 16/32-bit) |
1. 统一寻址与网络指令化:Locator:Function:Args
SRv6 将网络节点与业务行为统一抽象为 128 位的 IPv6 地址(Segment ID, 简称 SID),分为三个逻辑段:
Locator(定位符): 负责全网 Underlay 路由可达。普通中间节点只需按照标准 IPv6 路由(如 BGP/OSPFv3)进行最长前缀匹配转发,无需维护复杂的隧道表项。Function(功能指令): 指定目的节点执行的具体网络动作。End.DT4/End.DT6:解封装并进入指定 VRF 查找 IPv4/IPv6 路由表(实现 L3 多租户隔离)。End.DX2:解封装并将内层二层帧直接转发至指定出接口(实现 L2 EVPN 业务)。Args(参数段): 携带流表匹配、安全标记或网络遥测元数据。
2. EVPN over SRv6:扁平化多租户承载
控制平面依然采用成熟的 BGP-EVPN,但实现机制大幅简化:
在路由发布阶段,Egress Leaf 通过 BGP Prefix-SID 属性直接向全网通告业务 SID(例如 2001:db8:1::End.DT4)。
Ingress Leaf 收到租户数据后,直接将对应的 IPv6 SID 作为目的 IP 封装外层报文。报文在 Fabric 内部透明转发,无需在 Spine 节点上维护任何租户隔离状态。
3. SRv6 Policy 与智能源路由调度
针对 AI 算力集群中 RoCEv2 的大象流调度痛点,SRv6 提供了确定性的流量编排手段:
- 显式路径指定: Ingress Leaf 或集中式控制器根据链路实时遥测(Telemetry)状态,在报文中压入一组经过无拥塞链路的 SID 列表(Segment List)。
- 零状态中间转发: 中间 Spine 和交换节点只需机械地读取当前 SID 转发并执行指针偏移(Segments Left 减 1),完全不需要在核心交换机上配置和下发细颗粒度的流表。
4. SID 压缩技术:根治 MTU 损耗
为解决标准 128-bit SRH 头过长导致的报文膨胀问题,RFC9800标准化了NEXT-C-SID和REPLACE-C-SID两种压缩机制。通过将多个节点的短操作码(如 16-bit 或 32-bit)打包在同一个 128-bit IPv6 目的地址中,显著压缩了报文开销,兼顾了传统短包吞吐率与 ASIC 硬件查表性能。
SRv6在数据中心的典型应用
1. 面向AI后端网络的SRv6应用——MRC架构
由OpenAI、微软、英伟达、AMD、英特尔和博通开发的MRC架构(Resilient AI Supercomputer Networking using MRC and SRv6)就是一个很好的例子。
SRv6的一个核心原则是让应用程序控制其网络体验。在传输层实现MRC可以创建一个可编程网络,其中传输栈为每个数据包选择路径。通过在许多无状态的路径和平面上分发数据包,MRC避免了传统基于ECMP部署中常见的因流量低熵值导致的流冲突问题。这是应用定义网络的实际应用,由SRv6引入的可编程性使能。
2. SRv6容器网络(Container Network)——NetPila方案
阿里云的NetPila展示了SRv6如何将容器网络提升到超越VXLAN隧道的水平——通过将租户和接口标识直接嵌入IPv6/SRv6地址模型,实现了Pod之间无需隧道的直接连接,并显著增强了端点与网络的集成紧密度。
3. 基于SRv6的骨干/跨数据中心网络——eCore架构
阿里云的 eCore 是一个基于 IPv6/SRv6 的骨干/跨数据中心网络架构,通过统一的 IPv6 Underlay 和 SRv6 Traffic Engineering,将路径选择从传统的网络逐跳决策转变为可编程的端到端路径控制。
在 AI 场景中,eCore 进一步结合端网协同:服务器侧根据业务类型、QoS 等信息选择 Flow Label,由网络侧将 Flow Label 映射到不同的 SRv6 SID-List,从而实现 RDMA、高带宽、低成本等不同路径的精细化选择。
4. SRv6数据中心前端网络
- 彻底消除 DCI 性能瓶颈与协议断层:去除了 DCI 上的 EVPN-to-MPLS 复杂转换逻辑,DCI 降级为大容量普通 IPv6 路由器,消除多厂商在 DCI 互通时的协议兼容难题。
- NFV 实例与服务链极简编排:云网关、防火墙等 NFV 实例天然运行在通用 Linux/x86 宿主机上,原生支持 IPv6/SRv6 内核处理,服务链引流由硬编码转向灵活的指令序列编排。
- 业务下发与运维极度收敛:从“DC + DCI + WAN”三段式独立规划,转变为以业务为中心的端到端扁平化 L3VPN 架构。
5. SRv6服务链(Service Chaining)
- 将“服务”本身变成SID
这是最大的差异。在VXLAN网络中,服务节点(如防火墙)是拓扑中的一个“黑洞”,流量需要通过复杂的路由策略“扔”进去。而在SRv6中,每个服务节点或其特定接口都被分配了一个全球唯一的SID,服务链本质上就是将一个包含多个服务SID的Segment List附加在报文上,由网络自动完成编排。
- 统一控制面与转发面
VXLAN Overlay网络通常需要独立的控制面(如EVPN),服务链策略也依赖于控制器下发。SRv6则实现了控制面(IGP/BGP扩展通告SID)和转发面(SID封装)的统一,简化了协议栈,使得网络能更自主地执行服务链策略。
- “无状态”的服务链
传统服务链(如通过VRF手拉手)往往需要在服务节点上维护大量状态信息。SRv6的服务链是“无状态”的,路径和服务顺序完全由报文头中的SID列表决定,服务节点只需基于当前SID进行简单转发,无需维护每个流的状态,这大大简化了服务节点(尤其是第三方设备)的设计。
AsterNOS SRv6规格与路线图
为了实现上述端到端 SRv6 Fabric 的演进,星融元 AsterNOS 制定了清晰的 SRv6 特性演进路线图。目前,AsterNOS 已完整支持传统的 SRv6 和 REPLACE-C-SID 压缩,并计划于 2026Q4 全面支持 NEXT-C-SID (uSID),帮助企业构建面向 AI 算力时代的极简扁平化网络。
| 分类 | 子项 | 特性 | 支持 |
| SRv6 端点行为 | End | Endpoint | ✔ |
| End.X | Endpoint with L3 cross-connect (L3VPN) | ✔ | |
| End.DT4 | Endpoint with decapsulation and IPv4 table lookup (L3VPN) | ✔ | |
| End.DT6 | Endpoint with decapsulation and IPv6 table lookup (L3VPN) | ✔ | |
| End.DT46 | Endpoint with decapsulation and IP table lookup (L3VPN) | ✔ | |
| End.DX4 | Endpoint with decapsulation and IPv4 cross-connect (L3VPN) | Q4 | |
| End.DX6 | Endpoint with decapsulation and IPv6 cross-connect (L3VPN) | Q4 | |
| End.DX2 | Endpoint with decapsulation and L2 cross-connect (L2VPN) | ✔ | |
| End.DT2M | Endpoint with decapsulation and L2 broadcast (L2VPN) | ✔ | |
| End.DT2U | Endpoint with decapsulation and L2 unicast FDB lookup (L2VPN) | ✔ | |
| SID压缩 | uSID | uSID (NEXT-CSID) compression | Q4 |
| G-SID | G-SID (REPLACE-CScID) compression, 12 slots | ✔ | |
| 封装模式 | H.Insert.Red | Insert SRH in IPv6 with reduced encapsulation | Q4 |
| H.Encaps.Red | Encaps SR headend with reduced encapsulation | ✔ | |
| H.Encaps.L2.Red | Encaps SR headend over L2 layer with reduced encapsulation | Q4 | |
| 节点Flavors | USD | Ultimate Segment Decapsulation | ✔ |
| COC | G-SID mode, update DIP using compressed G-SID | ✔ | |
| IGP路由协议 | ISIS | ISIS for SRv6 | ✔ |
| ISIS FRR | Ti-LFA high availability | ✔ | |
| OSPF | OSPF for SRv6 | Q4 | |
| OSPF FRR | Ti-LFA high availability | Q4 | |
| BGP | BGP | BGP for SRv6 | ✔ |
| SRv6-BE | L3VPN | L3VPN over SRv6-BE | ✔ |
| EVPN L2VPN | VPLS (Type 1,2,3,4) | Q3 | |
| VPWS (Type 1,4) | Q3 | ||
| CCC | Q3 | ||
| Multi-homing | Q3 | ||
| EVPN L3VPN | Type 5 (IP Prefix Route) | ✔ | |
| SRv6-TE | Static TE Policy | Static SRv6 TE Policy | ✔ |
| TE Policy | Dynamic SRv6 TE Policy | Q4 | |
| L3VPN | L3VPN over SRv6-TE | ✔ | |
| EVPN L2VPN | VPLS/VPWS/CCC/Multi-homing over SRv6-TE | Q3/Q4 | |
| EVPN L3VPN | EVPN L3VPN (Type 1-5) over SRv6-TE | ✔ | |
| Telemetry | Telemetry | Collect data from switch remotely | ✔ |
| BGP-EPE | BGP-EPE | Allocate SID for BGP peer | ✔ |
| BGP-LS | SRv6 SID NLRI | SRv6 SID Information / Endpoint Behavior / BGP Peer Node SID TLV | Q4 |
| Node NLRI | SRv6 Capabilities / Node MSD Types TLV | Q4 | |
| Link NLRI | SRv6 End.X / LAN End.X / Link MSD Types TLV | Q4 | |
| Prefix NLRI | SRv6 SID Structure / Locator TLV | Q4 | |
| PCEP | PCEP for SRv6 | path-setup-type / capabilities / RRO / ERO subobject TLV | Q4 |
| SBFD | SBFD | Seamless BFD | Q4 |
| SRv6 OAM | SRv6 OAM | Checking reachability to destination SID or PW | Q4 |
| Flex-Algo | SRv6 Flex-Algo | Custom IGP route calculation algorithms | Q4 |
| OAM工具 | SID Ping | SID reachability pinge | Q4 |
| SID Tracert | SID path trace | Q4 | |
| TE Policy Ping | TE Policy reachability ping | Q4 | |
| TE Policy Tracert | TE Policy path trace | Q4 | |
| TWAMP | TWAMP | Two-Way Active Measurement Protocol | ✔ |
【参考文档】
- https://www.rfc-editor.org/rfc/rfc9800.html
- https://www.rfc-editor.org/info/rfc8402
- https://www.rfc-editor.org/info/rfc8754
- https://www.rfc-editor.org/info/rfc8986
MRC (Resilient AI Supercomputer Networking):
NetPila (阿里云 SRv6 容器网络) : https://datatracker.ietf.org/meeting/125/materials/slides-125-srv6ops-21-ipv6srv6-powering-alibaba-cloud-ai-computing-alibaba-02
eCore (阿里云 SRv6 骨干网):https://www.segment-routing.net/images/OCP-summit25-eCore_Alibaba.pdf
-
解读 AsterNOS 热重启技术:控制面动态重构与数据面持续转发 -
下一代数据中心网络重构:从 EVPN-VxLAN 走向端到端 SRv6 Fabric -
AIDC光模块选型与实践指南 -
一文读懂 MPLS:下一代园区网络的高速转发引擎 -
AIDC 网络运维平台全新发布:自动化极简开局、RoCE 灵活调参和网络可观测
星融元数据技术有限公司是领先的开放网络解决方案提供商,产品包括网络操作系统、数据中心交换机、AI智算交换机、园区交换机、开放式企业级路由和新一代网络可视化产品等。为行业企业、数据中心和云运营商提供基于通用解耦硬件和 SONiC 软件框架的全场景交钥匙网络解决方案,帮助用户构建AI时代中立、透明,易于运维、高性价比的基础网络。














