Skip to main content
开放网络的先行者与推动者—星融元
加入我们技术支持(Support)  TEL:(+86)4000989811

标签: 技术分享

智算网络上 800G 总踩坑?懂了这个“通用语言”,让光模块不再难搞

读懂CMIS状态机,800G光模块管理不再踩坑

封面图

在现代智算中心,网络带宽正从 400G 向 800G 乃至 1.6T 演进。这种快速增长带来了不同厂商、不同速度规格的光模块之间复杂的兼容性问题。

传统的 SFF 接口规范已无法满足复杂的800G网络的需求。作为新一代的光接口管理标准,CMIS正在逐渐成为高性能通算及智算中心场景中的光模块与交换机交互的通用语言。

本文探讨了 CMIS 的基本原理,并分享了在星融元数据中心交换机(AsterNOS)上使用 CMIS 管理光模块的实践经验。

什么是 CMIS?

CMIS(Common Management Interface Specification)协议是一种用于管理和监控光模块的通信协议。

早期光模块的开发依赖于SFF(Small Form Factor)标准系列,主要有以下历史标准:

  • SFF-8472:作为SFP/SFP+时代的标准,它支持数字诊断监控(DDM)。它使用I2C接口来获取电压、温度和光功率数据。
  • SFF-8636:随着向 4 通道架构(例如 QSFP+/QSFP28)的转变,该标准成为多通道模块的核心管理逻辑。

这些传统标准主要定义了 I2C 寄存器访问,但缺乏互操作性。随着网络速度向 800G 迈进,通道配置也变得日益复杂。

CMIS 的诞生提供了统一的管理协议,定义了光模块与系统管理软件之间的接口和数据格式,其中包括主机和模块如何交换信息,涵盖模块识别、状态监控、告警、功耗、温度和 DSP 配置等,并使得系统管理软件可以通过标准接口实现对光模块的配置、监控和管理。

CMIS 确保不同厂商的模块在管理层面上能够互操作,从而无需使用厂商特定的专有方案。

下表对比了传统 SFF 管理接口与现代 CMIS 标准:

标准对比 SFF-8472 / SFF-8636 CMIS
侧重点 SFP/QSFP 的基本监测 800G+ 全面管理和深度检测
运行方式 即插即用 CMIS状态机握手
检测深度 有限;简单的 I2C 命令 高级功能;支持眼图和pre-FEC分析
灵活性 速率特定 基于状态机的动态多速率支持
适用场景 企业网络,低速 高性能AIDC,大规模GPU集群
可扩展性 碎片化;1.6T+支持 统一架构;面向未来的支持

CMIS 并非单一的规范,而是一套基于由光互联论坛(OIF)管理的模块化框架。当前 CMIS base(v5.3)作为其核心基础,规定了通用管理接口、核心管理功能和标准内存映射, 同时也在迭代出一系列补充/分支协议来支持面向未来的升级,例如相干光模块(ZR/ZR+)和 共封装光学(CPO)等。

从“即插即用”转变为“按需配置

在25G或100G时代,光模块的通道数较少,工作模式固定,因此可以实现简单的即插即用。

然而,在800G时代,单通道速率(25G/50G/100G/200G)和通道配置差异显著。在某些场景下,光模块需要通过 CMIS 协议与交换机进行复杂的握手和动态配置才能正常运行。

基于状态机的握手

根据 CMIS Base v5.3,光模块和交换机之间的交互由严格的状态机控制,其功能类似于精确的开机自检:

  • 初始化:上电后,交换机通过标准 I2C 接口读取模块的身份并验证其基本功能。
  • 就绪:模块初始化完成后,进入就绪状态。此时,交换机可以检索详细参数,例如电压、温度和光功率,并发出业务配置命令。
  • 操作状态:模块仅在配置参数与物理链路匹配并经状态机确认后才进入操作状态。数据传输由此开始。

如果链路建立失败,交换机可以读取状态机代码,以确定模块是在“初始化”过程中停滞,还是由于“配置不匹配”而停滞。这为故障排除过程中的根本原因分析奠定了基础。

动态配置

CMIS Base v5.3 引入了使用应用程序代码的动态配置,从根本上改变了模块的管理方式:

  • 从静态预设到按需重配置:以前,模块的速率模式在出厂时就已经固定。现在,借助 CMIS,交换机可以实时地向模块推送不同的应用代码。
  • 基于场景的自适应:无论是将 800G 端口拆分为 4x200G 端口,还是切换调制格式(例如 PAM4),交换机只需指示模块“切换到模式[x]”。模块的内部 DSP 和电气接口会自动执行必要的参数调整。
  • 统一控制标准:无需手动操作复杂的寄存器地址。通过标准的CMIS接口,它确保了不同厂商的模块在高速网络环境下的互操作性和稳定性。

简而言之,由于网络业务的复杂化,光模块也从“即插即用”转变为“按需配置”;而借助 CMIS 接口,交换机可以指示光模块自动切换到所需模式以支持特定的业务需求。

800G AIDC 网络实践

CMIS 在生产中的核心价值体现在两个方面:提供光模块实时性能遥测数据(温度、电压、光功率和偏置电流),以及通过智能化运维管理解决高性能 AIDC 网络中遇到的链路问题,为AI集群提供更稳定的网络环境。例如:CMIS 可提供精细的信号质量指标(如 Pre-FEC的误码率),在光模块触发完全链路中断事件之前被检测到,有效地防止 AI 工作负载中出现计划外停机。

搭载 AsterNOS 的星融元数据中心交换机已集成 CMIS 协议,同时可通过 AIDC 运维平台提供可视化的管理界面,以下是近期我们基于 CMIS 在真实的 800G AIDC 网络交付中处理的两个现场案例。

产品

品牌 型号 端口规格 操作系统
星融元Asterfusion CX864E-N 64 x 800GE OSFP,2 x 10GE SFP+ AsterNOS-Datacenter(企业级SONiC发行版)
星融元Asterfusion CX732Q-N 32 x 400GE QSFP-DD/QSFP56/QSFP28/QSFP+, 2 x 10GE SFP+ 同上

Breakout 子接口的掉线

网络配置情况

本地为 CX864E-N 交换机,初始配置为 ethernet 0/16 4x200G breakout,链路正常运行。 对端为 CX732Q-N 交换机,配备两个 400G DR4 模块,并配置为 2x200G breakout。

问题

在 800G DR8 模块上执行 4x200G 的 breakout 时,当关闭其中一个子接口会触发其他子接口链路断开。具体来说,在 ethernet 0/16 接口上下发 shutdown 命令会导致接口 0/18、0/20 和 0/22 也同步断开。

配置情况截图

原因分析

由于未启用 CMIS,800G-DR8 模块默认使用应用代码 2(400G BASE-DR4 模式)。模块配置的速度与接口的实际数据速率不匹配,导致子接口之间相互干扰

解决路径

启用CMIS,系统自动识别端口要求并选择应用代码3(200G BASE-DR2模式)。由于电气接口速度匹配正确,链路立即稳定下来。

经过此项更改后,由于该模块现在锁定到正确的 200G BASE-DR2 模式,因此四个子接口在模块可在数据路径级别上独立运行,关闭 ethernet 0/16 不再影响接口0/18、0/20和0/22。

800G DR 模块在 8x100G Breakout 模式下不工作

问题

交换机插入 800G 模块后,状态指示灯不亮,所有相关接口均保持关闭状态。

配置截图

原因分析

该模块默认使用了错误的“应用代码2”模式(400G 通道速率),未能识别所需的 100G 通道速率配置。

配置截图

解决路径

启用CMIS后,该协议会根据端口配置自动将速率模式调整为应用代码“4”(100G 模式)。参数同步后,链路得以正常建立。

配置截图

相关阅读


产品型号: 星融元(Asterfusion)CX864E-N (64 x 800G OSFP)
功能特性:RoCEv2, PFC, ECN, DCBX ……
应用场景:GPU算力集群,分布式存储
最后更新:2026-05-18


相关文章

星融元数据技术有限公司是领先的开放网络解决方案提供商,产品包括网络操作系统、数据中心交换机、AI智算交换机、园区交换机、开放式企业级路由和新一代网络可视化产品等。为行业企业、数据中心和云运营商提供基于通用解耦硬件和 SONiC 软件框架的全场景交钥匙网络解决方案,帮助用户构建AI时代中立、透明,易于运维、高性价比的基础网络。

🔺关注 @星融元Asterfusion 微信公众号
WeChat QR Code

基于意图的一键编排:大规模 AIDC 网络业务的极速开通实践

从逐设备手工配置到分钟级一键交付 —— 星融元 AIDC 运维管理平台实践

AIDC运维-文章封面

在AI数据中心场景下,网络规模大、设备数量多,传统依赖逐台设备手工配置的部署方式难以满足快速交付与一致性要求。

基于意图的一键编排

AIDC 运维平台

星融元 AIDC 运维管理平台是专为 AI 智算中心打造的网络管理产品,通过 自动化部署与模板化编排 能力,将传统“逐设备配置”的部署模式转变为“基于意图的一键编排”,以提升AI数据中心网络的交付效率。

  • 设备自动上线与集中纳管(ZTP)
  • 基于场景模板的拓扑自动生成
  • 规划拓扑与真实拓扑的自动校验
  • 分阶段配置下发与业务快速开通

快速配置流程

第一步:设备自动上线和入库

设备完成基础上架并配置网络运维平台 IP 地址后,将自动通过 WebSocket 与平台建立连接。连接建立后,设备将被自动纳入平台统一管理,并进入默认资源池(组织)。

管理员可根据实际部署需求,将设备批量划分至指定场所或业务域,用于后续拓扑规划与业务部署。

AIDC运维平台

第二步:场景拓扑自动化生成和校验

选择模板:根据场景一键生成所需组网拓扑

一个标准的 AI 智算中心架构主要分为计算后端网、前端网(业务应用网)、存储网和带外管理网。

网络分类 流量方向 核心追求 常见应用场景
AI 后端网 东西向(卡对卡) 超低时延、零丢包、高带宽 大模型分布式并行训练、梯度同步
AI 前端网 南北向(内外交互) 高可用、通用性、灵活性 任务提交、API 调用、推理服务响应
存储网 东西/南北结合 高吞吐量、并发读写 训练数据集加载、模型 Checkpoint 读写
带外管理网 运维控制 极高可靠性、物理隔离 远程开关机、BMC 监控、固件升级

面向智算中心不同网络的需求(也兼顾传统数据中心网络),该平台目前支持以下几种常见的场景配置模板。

AIDC运维平台

  • AIDC 后端网络(AI 训练网)

AIDC 后端网络连接到 GPU 服务器集群,负责 GPU/NPU 节点之间东西向高吞吐和超低时延通信(参数和梯度交换)。在大模型并行训练(如数据并行、流水线并行、张量并行)中,全归约(All-Reduce)等集合通信算法极度依赖 AI 后端网的性能。

该标准模板采用 Spine-Leaf 架构,支持大规模节点接入,包含交换机 RoCE、智能选路及 ARS(自适应路由切换)等配置能力,以满足高带宽、低时延及无损传输需求。

  • AIDC 前端网络(业务管理网络)

AIDC 前端网负责南北向业务流量和常规的管理调度通信,包含训练任务的提交、集群 API 交互、推理服务接入以及互联网/企业内网的访问。

该标准模板基于交换机 EVPN MC-LAG 技术实现链路冗余与业务隔离,保障业务接入的高可靠性。

  • AIDC 存储网络(存储后端网络)

AIDC 存储网络是连接 GPU 计算节点与高性能分布式存储(如并行文件系统/对象存储)的专网,要求同时具备高并发读取带宽和极高写入吞吐量。

该标准模板支持配置分布式网关、MC-LAG 及 RoCE 技术,提升存储访问性能与可靠性。

  • 数据中心融合网络

支持基于 EVPN MC-LAG 或 EVPN Multihoming 的典型组网方式,适用于传统数据中心业务场景。

自动校验拓扑:确认设备实际连接同规划一致

AIDC运维平台

设备上线后,网络运维平台自动发现设备间的链路关系,生成真实网络拓扑,并与规划拓扑进行一致性校验,校验通过后,即可进入配置下发阶段。

第三步:分阶段的业务配置下发

基础网络配置:以AI 后端网为例,该阶段自动建立BGP邻居,用户无需为互联口手动规划IP地址;Spine交换机宣告各 Rail 网段路由,实现全网互通,BGP Peer-group 批量下发,向全网设备推送基础网络配置,等待状态同步完成即可进入业务配置阶段。

运维

业务配置:根据业务需求启用相关功能,例如 VLAN 与网关规划,自适应路由切换(ARS)等

AIDC 运维平台

第四步:RoCE 网络的优化设置

在 AI 数据中心网络中,RoCE 相关参数(如PFC、ECN)的配置对网络性能具有重要影响。不同业务场景下对时延、吞吐及拥塞控制的要求存在差异。

星融元 AIDC 络运维平台采用“模板化配置 + 参数微调”的方式,实现RoCE网络的高效部署与精细化优化:

RoCE 参数配置模板:平台内置多种面向典型AI业务场景的 RoCE 参数模板,预定义 PFC 优先级、ECN 标记策略等关键参数组合。用户可根据业务类型选择合适模板,快速完成网络基础配置,降低参数配置复杂度。

AIDC运维-RoCE参数配置模版

RoCE 参数微调:如下图所示,在模板基础上,平台支持对 PFC、ECN 等关键参数进行灵活调整,例如 ECN 标记阈值、队列水线等,以适配具体业务负载特征,实现性能的进一步优化。

AIDC运维-RoCE参数微调

涉及交换机设备

AIDC 网络运维平台目前支持管理 CX-N系列交换机,产品基础规格参数如下。

https://asterfusion.com/product/cx-n/


产品型号: 星融元(Asterfusion)ET3600系列智能网关平台
支持协议:PTP,IPSec,SSL/TLS……

应用场景:企业路由器,路由器,防火墙,VPN网关,负载均衡器,IDS/IPS,网络流量分析器
最后更新:2026-05-18



产品型号: 星融元(Asterfusion)ET2500系列智能网关平台
支持协议:PTP,IPSec,SSL/TLS……

应用场景:路由器,防火墙,VPN网关,负载均衡器,IDS/IPS,网络流量分析器
最后更新:2026-05-18


相关文章

星融元数据技术有限公司是领先的开放网络解决方案提供商,产品包括网络操作系统、数据中心交换机、AI智算交换机、园区交换机、开放式企业级路由和新一代网络可视化产品等。为行业企业、数据中心和云运营商提供基于通用解耦硬件和 SONiC 软件框架的全场景交钥匙网络解决方案,帮助用户构建AI时代中立、透明,易于运维、高性价比的基础网络。

🔺关注 @星融元Asterfusion 微信公众号
WeChat QR Code

解读 AsterNOS 热重启技术:控制面动态重构与数据面持续转发

解耦控制与转发,保障关键业务永续在线

warm reboot

在现代云数据中心网络及AI智算中心网络中,高可用性和业务连续性是衡量网络基础设施能力的核心指标。

传统的设备冷重启(Cold Reboot)方式在进行软件重载时,会导致交换机的控制平面与数据转发平面同时中断,这往往会引发协议邻居断开、路由重新收敛等一系列连锁影响,进而造成数分钟的流量中断,会对网络连续性要求较高的业务产生较大影响。

由此,热重启(Warm Reboot)技术应运而生。

什么是热重启?

区别于冷重启,热重启的目标是在尽量不影响数据平面的前提下,重启和升级软件,包括其中的每个独立进程/容器的热重启也属于该目标的范畴。

星融元 AsterNOS 对热重启的支持得益于 SONiC 架构所提供的控制平面与数据平面解耦、模块化和容器化设计。

与传统封闭式网络操作系统中架构不同,AsterNOS 软件进程与底层硬件状态并非高度耦合,而是将核心网络功能和系统服务以容器化、模块化方式运行,并通过 Redis 数据库对系统配置及各模块间的运行状态进行统一管理和交互。这为系统状态的持久化和快速恢复提供了基础。

AsterNOS 软件架构

热重启基本工作原理

AsterNOS 实现热重启的核心机制是:在交换机控制面软件重启过程中,持久化保存关键系统配置及运行状态,同时保持底层ASIC中已有的转发状态,使数据平面能够继续利用原有的硬件转发表项进行数据转发。

当控制面软件完成重启并恢复运行后,通过状态同步机制恢复对数据平面的正常管理,从而实现控制面快速恢复与业务连续性的兼顾。

AsterNOS 热重启机制架构图

网络应用程序与Orchagent:Orchagent是SONiC交换机状态服务 (SwSS) 容器内部的中央编排和转换引擎,每个应用程序及其对应的Orchagent子模块需要协同工作,以恢复原始数据并生成用热启动的增量数据。

Syncd:在重启之前,Syncd将ASIC_DB的数据转储出去。当 Syncd 容器热启动重新拉起后,将读取转储数据,从而在内存中重构出重启前的软件内部状态。Syncd 会接收来自 Orchagent 的变更数据,并在进行必要的转换后将其传递给 LibSAI/ASIC。

LibSAI/ASIC:ASIC芯片在软件重载期间须保持原有的硬件转发表项持续运行,确保数据平面的转发流量不中断。LibSAI 通过读取重启前保留的序列化文件,接管当前正在工作状态的 ASIC 芯片。

AsterNOS 的视图协调和匹配算法

为了让热重启后重构的“控制面状态”与未曾中断的“底层硬件状态”完美对接,星融元 AsterNOS 网络操作系统采用视图协调机制与匹配算法,避免对硬件进行破坏性的全量覆写,其主要步骤如下:

构建双视图

  • 当前视图(Current View):重启前已经下发到 ASIC,且在重启期间硬件正在使用的真实状态;
  • 临时视图(Temporary View):代表本次控制面热重启后,根据数据库重新计算并期望下发的目标状态。

快速匹配

  • 算法优先提取那些在热重启期间不会发生改变的“交换机内部固定对象”(不变量,如物理端口、硬件队列、调度器等)作为锚点;
  • 对比临时视图和当前视图中这类对象的 VID,如果 VID相同,它们对应的物理 RID 也必定一致,算法直接将其标为 MATCHED 状态,免除后续深度遍历,极大地降低算法开销。

深度过渡比对

  • 算法以不变量为锚点,对于临时视图中的每个对象,向下递归比对。
  • 对每个临时对象,在当前视图中查找一个最适合复用的对象。若未找到匹配项,则向硬件下发新增指令;若找到最佳匹配但其包含的属性不同,则下发差异更新指令;若找到精确匹配且属性一致,则直接复用,不产生任何底层写入。

陈旧表项清理

比对完成后,扫描当前视图中所有未被标记为MATCHED 且引用计数归零的对象,将其从硬件中安全移除。通过一致性绝对优先策略,确保控制面与数据平面状态达到一致。

典型应用场景

AI智算中心:保障大规模训练业务连续性

在构建千卡及万卡级别的 AI 分布式训练集群时,大模型训练周期通常长达数周甚至数月。在此期间,交换机系统的软件版本升级和漏洞修复是不可规避的运维行为。

如采用传统的整机冷重启,会导致集群内大范围的网络中断,直接打断正在运行的分布式计算任务,导致 GPU 算力闲置与资源浪费。

借助星融元 AsterNOS 的热重启技术,运维人员可以对交换机操作系统执行无缝的热升级。在系统热重启过程中,底层交换芯片保持转发,从而实现数据中心网络的热平滑维护,提升了算力集群的整体可用性。

AI智算中心热重启示意图

云数据中心:实现关键业务平滑升级

在多租户的公有云和私有云数据中心中,网络承载着大量对丢包和时延高度敏感的关键业务,如在线金融交易、实时音视频、云存储数据同步等。

传统的交换机升级往往需要复杂的流量引避流程,若直接执行冷重启,会导致 Spine 或 Leaf节点出现长达数分钟的流量黑洞与业务中断。

借助热重启技术,网络运维团队能够在真实业务流量持续运转的“带流”状态下,对现网交换机执行平滑的在线软件升级。在控制面操作系统重载、路由协议(如BGP等)执行平滑重启与状态重建的过程中,底层硬件 ASIC 芯片基于重启前锁定并固化的转发表项,持续提供线速数据转发。

这种机制确保了云数据中心在进行网络版本迭代、新特性发布或紧急安全打补丁时,实现业务层面的“无感升级”与数据面平滑切换,使底层网络基础设施的演进对云端租户透明。

云数据中心热重启示意图

数据中心交换机


产品型号:数据中心交换机
功能特性:RoCEv2, PFC, ECN, DCBX ……
应用场景:GPU算力集群,数据中心,分布式存储
最后更新:2026-05-26


相关文章

星融元数据技术有限公司是领先的开放网络解决方案提供商,产品包括网络操作系统、数据中心交换机、AI智算交换机、园区交换机、开放式企业级路由和新一代网络可视化产品等。为行业企业、数据中心和云运营商提供基于通用解耦硬件和 SONiC 软件框架的全场景交钥匙网络解决方案,帮助用户构建AI时代中立、透明,易于运维、高性价比的基础网络。

🔺关注 @星融元Asterfusion 微信公众号
WeChat QR Code

下一代数据中心网络重构:从 EVPN-VxLAN 走向端到端 SRv6 Fabric

从VxLAN到SRv6:面向AI算力时代的网络底座演进

SRv6

在过去十年的云计算演进中,EVPN-VxLAN 几乎是数据中心虚拟化与多租户网络的标准底座。它打破了传统 VLAN 4096 的隔离上限,在三层物理网络(Underlay)之上构建起无感漂移的虚拟二层网络(Overlay)。

然而,随着大模型分布式训练、高密 GPU 算力集群以及跨数据中心协同计算的爆发,网络流量特征发生了根本性变化。传统 VxLAN 架构在面对海量大象流调度、跨域协议打通以及报文封装开销时,逐渐暴露出结构性短板。基于原生 IPv6 的 SRv6(Segment Routing over IPv6)正迅速从广域网下沉至数据中心内部,有望成为新一代算力 Fabric 的核心底座。

为什么 VxLAN 在 AI 与多云时代难以为继?

在传统通用云场景下,VxLAN 很好地满足了虚拟机和容器的多租户隔离诉求。但当基础设施向异构算力和多中心协同演进时,VxLAN 的局限性越发明显:

VxLAN的局限性

1. 跨域“协议缝合”(Protocol Stitching)与网关瓶颈

在多数据中心(DCI)或混合云互联场景中,数据中心内部通常运行 EVPN-VxLAN,而广域网骨干网多采用 MPLS、SR-MPLS 或纯 IP 路由。

状态开销与单点瓶颈: 出入数据中心的边界网关(Border Leaf / DCI Gateway)必须承担复杂的协议转译与状态维护工作——解封装 VxLAN、剥离内部标签、查询路由并重新封装为 MPLS/WAN 报文。

运维割裂: DC 内部与跨域骨干网使用完全不同的 OAM 监测机制,端到端故障定界与性能遥测极为困难。

2. 算力“大象流”遭遇 ECMP 极化

AI 智算集群(如 LLM 预训练与微调)的通信模式以大跨度集合通信(AllReduce、All-to-All)为主,流量表现为流数少、突发单流吞吐大(大象流)。

  • 哈希碰撞(Hash Collision): 传统数据中心依赖等价多路径路由(ECMP)分发流量。VxLAN 依赖外层 UDP 源端口做哈希分流,少量突发大象流极易被哈希至同一条物理链路,引发局部严重拥塞。
  • PFC 风暴与 MFU 下降: 在 RoCEv2 无损网络中,链路拥塞会频繁触发 PFC(优先级流量控制)反压,严重时导致 PFC 死锁或巨量排队时延,最终拉低整个集群的算力利用率(MFU, Model FLOPs Utilization)。VxLAN 本身缺乏灵活的流量工程(TE)能力,无法根据网络拥塞实时调度路径。

3. 封装开销与芯片流水线解析代价

VXLAN vs SRv6

标准 VxLAN 引入了至少 50 字节的额外包头开销(外层 MAC + IPv4 + UDP + VxLAN Header)。在大模型梯度同步与频繁的参数小包交互中,这不仅降低了有效载荷的吞吐利用率,也对交换机 ASIC 的报文解析深度(Parsing Depth)和查表流水线造成额外负担。

新一代 SRv6 Fabric 的技术原理

SRv6

SRv6(Segment Routing over IPv6)并非简单的隧道协议,而是基于“源路由(Source Routing)”理念与原生 IPv6 扩展头构建的网络可编程指令集。

核心维度 EVPN-VxLAN 架构 下一代 SRv6 Fabric 架构
转发平面 IPv4/IPv6 Underlay + UDP 封装 + VxLAN 头部 原生 IPv6 + 路由扩展头(SRH / NEXT-CSID / REPLACE-CSID)
模块扩展性 极差(需要厂商为第三方模块适配源码)。 优秀(原生二进制模块 100% 即插即用)。
控制平面 BGP EVPN(分配 VNI / L2-L3 标签) BGP EVPN(分配 SRv6 SID,如 End.DT4/DT6)
跨域能力 依赖边界网关进行解封与标签重写 全网统一 IPv6 寻址,端到端一跳直达
流量工程 (TE) 依赖 Underlay 独立机制,Overlay 无法干预 SRv6 Policy 显式路径编排,毫秒级源路由避障
报文开销 固定 50 字节封装开销 支持C-SID压缩编码(每跳仅占 16/32-bit)

1. 统一寻址与网络指令化:Locator:Function:Args

SRv6 将网络节点与业务行为统一抽象为 128 位的 IPv6 地址(Segment ID, 简称 SID),分为三个逻辑段:

 统一寻址与网络指令化

统一寻址与网络指令化

  • Locator(定位符): 负责全网 Underlay 路由可达。普通中间节点只需按照标准 IPv6 路由(如 BGP/OSPFv3)进行最长前缀匹配转发,无需维护复杂的隧道表项。
  • Function(功能指令): 指定目的节点执行的具体网络动作。
  • End.DT4 / End.DT6:解封装并进入指定 VRF 查找 IPv4/IPv6 路由表(实现 L3 多租户隔离)。
  • End.DX2:解封装并将内层二层帧直接转发至指定出接口(实现 L2 EVPN 业务)。
  • Args(参数段): 携带流表匹配、安全标记或网络遥测元数据。

2. EVPN over SRv6:扁平化多租户承载

控制平面依然采用成熟的 BGP-EVPN,但实现机制大幅简化:

在路由发布阶段,Egress Leaf 通过 BGP Prefix-SID 属性直接向全网通告业务 SID(例如 2001:db8:1::End.DT4)。

Ingress Leaf 收到租户数据后,直接将对应的 IPv6 SID 作为目的 IP 封装外层报文。报文在 Fabric 内部透明转发,无需在 Spine 节点上维护任何租户隔离状态。

EVPN over SRv6

3. SRv6 Policy 与智能源路由调度

针对 AI 算力集群中 RoCEv2 的大象流调度痛点,SRv6 提供了确定性的流量编排手段:

  • 显式路径指定: Ingress Leaf 或集中式控制器根据链路实时遥测(Telemetry)状态,在报文中压入一组经过无拥塞链路的 SID 列表(Segment List)。
  • 零状态中间转发: 中间 Spine 和交换节点只需机械地读取当前 SID 转发并执行指针偏移(Segments Left 减 1),完全不需要在核心交换机上配置和下发细颗粒度的流表。

 SRv6 Policy

4. SID 压缩技术:根治 MTU 损耗

SID 压缩技术

为解决标准 128-bit SRH 头过长导致的报文膨胀问题,RFC9800标准化了NEXT-C-SID和REPLACE-C-SID两种压缩机制。通过将多个节点的短操作码(如 16-bit 或 32-bit)打包在同一个 128-bit IPv6 目的地址中,显著压缩了报文开销,兼顾了传统短包吞吐率与 ASIC 硬件查表性能。

SRv6在数据中心的典型应用

1. 面向AI后端网络的SRv6应用——MRC架构

由OpenAI、微软、英伟达、AMD、英特尔和博通开发的MRC架构(Resilient AI Supercomputer Networking using MRC and SRv6)就是一个很好的例子。

SRv6的一个核心原则是让应用程序控制其网络体验。在传输层实现MRC可以创建一个可编程网络,其中传输栈为每个数据包选择路径。通过在许多无状态的路径和平面上分发数据包,MRC避免了传统基于ECMP部署中常见的因流量低熵值导致的流冲突问题。这是应用定义网络的实际应用,由SRv6引入的可编程性使能。

MRC架构

2. SRv6容器网络(Container Network)——NetPila方案

阿里云的NetPila展示了SRv6如何将容器网络提升到超越VXLAN隧道的水平——通过将租户和接口标识直接嵌入IPv6/SRv6地址模型,实现了Pod之间无需隧道的直接连接,并显著增强了端点与网络的集成紧密度。

NetPila方案

3. 基于SRv6的骨干/跨数据中心网络——eCore架构

阿里云的 eCore 是一个基于 IPv6/SRv6 的骨干/跨数据中心网络架构,通过统一的 IPv6 Underlay 和 SRv6 Traffic Engineering,将路径选择从传统的网络逐跳决策转变为可编程的端到端路径控制。

在 AI 场景中,eCore 进一步结合端网协同:服务器侧根据业务类型、QoS 等信息选择 Flow Label,由网络侧将 Flow Label 映射到不同的 SRv6 SID-List,从而实现 RDMA、高带宽、低成本等不同路径的精细化选择。

eCore架构

4. SRv6数据中心前端网络

SRv6数据中心前端网络

  • 彻底消除 DCI 性能瓶颈与协议断层:去除了 DCI 上的 EVPN-to-MPLS 复杂转换逻辑,DCI 降级为大容量普通 IPv6 路由器,消除多厂商在 DCI 互通时的协议兼容难题。
  • NFV 实例与服务链极简编排:云网关、防火墙等 NFV 实例天然运行在通用 Linux/x86 宿主机上,原生支持 IPv6/SRv6 内核处理,服务链引流由硬编码转向灵活的指令序列编排。
  • 业务下发与运维极度收敛:从“DC + DCI + WAN”三段式独立规划,转变为以业务为中心的端到端扁平化 L3VPN 架构。

SRv6数据中心前端网络

5. SRv6服务链(Service Chaining)

SRv6服务链(Service Chaining)

  • 将“服务”本身变成SID

这是最大的差异。在VXLAN网络中,服务节点(如防火墙)是拓扑中的一个“黑洞”,流量需要通过复杂的路由策略“扔”进去。而在SRv6中,每个服务节点或其特定接口都被分配了一个全球唯一的SID,服务链本质上就是将一个包含多个服务SID的Segment List附加在报文上,由网络自动完成编排。

  • 统一控制面与转发面

VXLAN Overlay网络通常需要独立的控制面(如EVPN),服务链策略也依赖于控制器下发。SRv6则实现了控制面(IGP/BGP扩展通告SID)和转发面(SID封装)的统一,简化了协议栈,使得网络能更自主地执行服务链策略。

  • “无状态”的服务链

传统服务链(如通过VRF手拉手)往往需要在服务节点上维护大量状态信息。SRv6的服务链是“无状态”的,路径和服务顺序完全由报文头中的SID列表决定,服务节点只需基于当前SID进行简单转发,无需维护每个流的状态,这大大简化了服务节点(尤其是第三方设备)的设计。

AsterNOS SRv6规格与路线图

为了实现上述端到端 SRv6 Fabric 的演进,星融元 AsterNOS 制定了清晰的 SRv6 特性演进路线图。目前,AsterNOS 已完整支持传统的 SRv6 和 REPLACE-C-SID 压缩,并计划于 2026Q4 全面支持 NEXT-C-SID (uSID),帮助企业构建面向 AI 算力时代的极简扁平化网络。

分类 子项 特性 支持
SRv6 端点行为 End Endpoint
End.X Endpoint with L3 cross-connect (L3VPN)
End.DT4 Endpoint with decapsulation and IPv4 table lookup (L3VPN)
End.DT6 Endpoint with decapsulation and IPv6 table lookup (L3VPN)
End.DT46 Endpoint with decapsulation and IP table lookup (L3VPN)
End.DX4 Endpoint with decapsulation and IPv4 cross-connect (L3VPN) Q4
End.DX6 Endpoint with decapsulation and IPv6 cross-connect (L3VPN) Q4
End.DX2 Endpoint with decapsulation and L2 cross-connect (L2VPN)
End.DT2M Endpoint with decapsulation and L2 broadcast (L2VPN)
End.DT2U Endpoint with decapsulation and L2 unicast FDB lookup (L2VPN)
SID压缩 uSID uSID (NEXT-CSID) compression Q4
G-SID G-SID (REPLACE-CScID) compression, 12 slots
封装模式 H.Insert.Red Insert SRH in IPv6 with reduced encapsulation Q4
H.Encaps.Red Encaps SR headend with reduced encapsulation
H.Encaps.L2.Red Encaps SR headend over L2 layer with reduced encapsulation Q4
节点Flavors USD Ultimate Segment Decapsulation
COC G-SID mode, update DIP using compressed G-SID
IGP路由协议 ISIS ISIS for SRv6
ISIS FRR Ti-LFA high availability
OSPF OSPF for SRv6 Q4
OSPF FRR Ti-LFA high availability Q4
BGP BGP BGP for SRv6
SRv6-BE L3VPN L3VPN over SRv6-BE
EVPN L2VPN VPLS (Type 1,2,3,4) Q3
VPWS (Type 1,4) Q3
CCC Q3
Multi-homing Q3
EVPN L3VPN Type 5 (IP Prefix Route)
SRv6-TE Static TE Policy Static SRv6 TE Policy
TE Policy Dynamic SRv6 TE Policy Q4
L3VPN L3VPN over SRv6-TE
EVPN L2VPN VPLS/VPWS/CCC/Multi-homing over SRv6-TE Q3/Q4
EVPN L3VPN EVPN L3VPN (Type 1-5) over SRv6-TE
Telemetry Telemetry Collect data from switch remotely
BGP-EPE BGP-EPE Allocate SID for BGP peer
BGP-LS SRv6 SID NLRI SRv6 SID Information / Endpoint Behavior / BGP Peer Node SID TLV Q4
Node NLRI SRv6 Capabilities / Node MSD Types TLV Q4
Link NLRI SRv6 End.X / LAN End.X / Link MSD Types TLV Q4
Prefix NLRI SRv6 SID Structure / Locator TLV Q4
PCEP PCEP for SRv6 path-setup-type / capabilities / RRO / ERO subobject TLV Q4
SBFD SBFD Seamless BFD Q4
SRv6 OAM SRv6 OAM Checking reachability to destination SID or PW Q4
Flex-Algo SRv6 Flex-Algo Custom IGP route calculation algorithms Q4
OAM工具 SID Ping SID reachability pinge Q4
SID Tracert SID path trace Q4
TE Policy Ping TE Policy reachability ping Q4
TE Policy Tracert TE Policy path trace Q4
TWAMP TWAMP Two-Way Active Measurement Protocol

【参考文档】

MRC (Resilient AI Supercomputer Networking):

NetPila (阿里云 SRv6 容器网络) : https://datatracker.ietf.org/meeting/125/materials/slides-125-srv6ops-21-ipv6srv6-powering-alibaba-cloud-ai-computing-alibaba-02

eCore (阿里云 SRv6 骨干网):https://www.segment-routing.net/images/OCP-summit25-eCore_Alibaba.pdf


产品型号:数据中心交换机
功能特性:RoCEv2, PFC, ECN, DCBX ……
应用场景:GPU算力集群,数据中心,分布式存储
最后更新:2026-05-26


相关文章

星融元数据技术有限公司是领先的开放网络解决方案提供商,产品包括网络操作系统、数据中心交换机、AI智算交换机、园区交换机、开放式企业级路由和新一代网络可视化产品等。为行业企业、数据中心和云运营商提供基于通用解耦硬件和 SONiC 软件框架的全场景交钥匙网络解决方案,帮助用户构建AI时代中立、透明,易于运维、高性价比的基础网络。

🔺关注 @星融元Asterfusion 微信公众号
WeChat QR Code

AIDC光模块选型与实践指南

速率、距离、封装、兼容性,四个维度讲透选型

光模块相关文章封面

给AI算力集群配光模块,最容易栽跟头。看着都是400G,接口也长得一样,插上就是不亮。机房一排GPU等着联网,整个集群的部署进度,就卡在这么一个小小的模块上。为什么?

实际上光模块的参数远比看起来复杂。从100G到400G、800G,传输距离有SR、DR、FR、LR之分,封装有QSFP和OSFP,光纤还分多模和单模……任何一个参数不匹配,代价都是一条不通的链路。根据LightCounting的预测,2026年全球数通光模块市场规模有望达到228亿美元,800G和1.6T产品合计占比约64%。

LightCounting预测

来源:LightCounting,华泰证券

这篇文章内容基于一线数据中心的选型与部署经验,覆盖10G到800G的主流光模块,从技术原理、场景适配,到兼容性避坑和故障排查,逐一展开。

光模块基础知识

光模块的技术演进始终以速率为核心驱动力。从10G到1.6T,每一代产品都在为满足数据中心不断增长的带宽需求而迭代。目前数据中心最常用的光模块速率覆盖25G、100G、200G、400G和800G,1.6T光模块随着单端口1.6T交换机的推出,也将在2026年下半年逐步进入商用。

调制技术

调制技术是决定光模块速率上限的核心因素。当前主流的两种调制方式分别是NRZ(不归零编码)和PAM4(四电平脉冲幅度调制)。

  • NRZ使用两个信号电平(高和低),每个时钟周期传输1比特数据,误码率低但频谱效率仅为1 bit/symbol。它主要用于单通道10G到25G的速率场景。
  • PAM4使用四个不同的信号电平,每个时钟周期可传输2比特数据,频谱效率是NRZ的两倍。这使得PAM4能够在单通道上实现50G、100G甚至200G的速率。目前400G、800G和1.6T光模块均以PAM4调制为主。

💡 Tips: 如果你的网络需要25G以上单通道速率,基本可以锁定PAM4方案。但要注意,PAM4对信号质量要求更高,通常需要配合FEC(前向纠错)来保证链路稳定性。

速率级别 调制技术 通道数 核心应用与特点
10G/25G NRZ 单通道 传统企业数据中心服务器接入
40G/100G NRZ 4通道 传统云计算网络主力
200G/400G PAM4 4/8通道 云数据中心Spine-Leaf及早期AI集群
800G PAM4 8通道 高端AI集群(H100)
1.6T PAM4 8通道 下一代AI芯片(Blackwell),硅光主流

主流连接介质:DAC、AEC、AOC和标准光纤跳线如何选?

光模块之间的连接线缆主要有以下类型:

  • DAC(直连铜缆) :内部为纯铜线,无源设备。优点是成本低、功耗低、时延低;缺点是传输距离极短(高速率下衰减更快),且线缆较粗重。适合机柜内3米以内的短距连接。
  • AEC(有源电缆) :在DAC基础上增加了retimer芯片,线缆更细,传输距离可达5-7米,但仍属于短距方案。
  • AOC(有源光缆) :两端光模块与光缆一体化封装。重量轻、传输距离远(30-50米),是机房内机柜间连接的优选方案。
  • 多模光纤 (MMF, OM3/OM4/OM5): 配合SR(Short Reach)模块,适用于距离<100米的链路(如同一机房内)。
  • 单模光纤 (SMF, OS2): 配合DR/FR/LR/CWDM模块,适用于500米至10公里以上的。

💡Tips:3米以内选DAC,5-7米选AEC,30-50米可选AOC或标准光纤跳线,100米以上必须用标准光纤跳线配合对应的光模块。

光模块选型的核心指标

在实际选型中,速率和传输距离以及封装形态是最基本的考量指标。

模块型号的后缀种类:SR、DR、FR、LR、ZR

后缀 全称 传输距离 光纤类型 典型场景
SR Short Reach 小于100米 多模 机柜内、同列短距
DR Data Center Reach 500米 单模 数据中心机房内部
FR Far Reach 2千米 单模 跨楼层/跨楼宇
LR Long Reach 10千米 单模 跨园区
ZR Ultra Long Reach 80千米+ 单模 城域互联

其中DR模块是目前数据中心机房内部署最多的类型,兼顾了传输距离和成本效益。ZR模块采用相干技术,价格昂贵,主要用于城域间的超长距传输。

多模光纤 vs 单模光纤

  • 多模光纤配合SR短距模块,性价比高,适用于100米以内的短距链路。常用光纤规格为OM3、OM4、OM5。
  • 单模光纤配合DR、FR、LR等模块,支持更长距离传输和更完整的信号质量,但造价更高。

💡Tips:在传输距离能满足的前提下,优先选择多模方案以降低成本。当距离超过100米时,转向单模方案。

封装形态:QSFP与OSFP的选择

封装形态决定了光模块与交换机端口的物理兼容性:

  • QSFP系列(QSFP+、QSFP28、QSFP-DD):25G、100G、200G、400G均采用此封装,向后兼容性好。QSFP-DD在QSFP28外形上增加通道数实现400G,且向下兼容QSFP28。
  • OSFP:体积更大、散热更好,主要用在800G及以上的设备中。OSFP的散热优势使其成为NVIDIA AI网络和800G环境中的主流选择。OSFP最大功耗可达15W,比QSFP-DD高出3W。

💡Tips:QSFP和OSFP的物理外观完全不同,无法互相适配。如果是新建AI集群,OSFP是更面向未来的选择;如果是从现有QSFP基础设施升级,QSFP-DD的向后兼容性更有优势。

数据中心组网场景下的光模块选型实践

速率 典型模块 封装形态 介质与距离 接口 核心应用
800G 800G-SR8/DR8/2xDR4/LPO/AOC OSFP/QSFP-DD800 OM4 50m/OS2 500m-2km/AOC 1-30m MPO-16/MPO APC/LC 大模型训练集群H100/GPU互联
400G 400G-SR8/DR4/FR4/LR4 QSFP-DD 多模100m/单模500m-10km MPO-16/MPO-12 APC/LC 云数据中心 Spine-Leaf骨干
200G 200G-SR4/FR4/LR4/DAC/AOC QSFP56 多模100m/单模2-10km MPO-12/LC 200G IB HDR网络、汇聚层
100G 100G-SR4/CWDM4/LR4 QSFP28 多模100m/单模2-10km MPO-12/LC 云计算ToR接入与汇聚
10G/25G 25G-SR/LR/10GBASE-T SFP28/SFP+ 多模/单模/网线 LC/RJ45 边缘数据中心与老旧存储接入

Leaf-Spine架构的选型策略

在典型的Leaf-Spine二层组网中,不同层级的光模块选型策略截然不同:

  • Leaf到服务器(机柜内,3米以内) :服务器网卡(如100G CX5)与TOR交换机之间的连接,选型优先级为100G DAC > AOC > SR。DAC性价比最高。
  • Leaf到Spine(跨机柜/跨机房,50米-500米) :DAC不再适用,需要根据速率(如400G Spine)选择对应的单模模块(DR或FR),配合单模光纤。

AI算力集群800G光模块选型

大模型训练驱动的AI算力集群对光模块提出了更高要求:

  • 计算节点(如NVIDIA H100,8张800G网卡)与交换机之间:短距连接,选择800G SR模块,配合多模光纤。
  • Spine层之间:传输距离更长,需要选择800G DR8或2×DR4模块,配合单模光纤。
  • 800G端口支持breakout拆分(如800G拆分为4×200G)时,需确认交换机是否支持对应的拆分模式。

光模块兼容性

光模块的兼容性是数据中心部署中最常见也最棘手的问题之一。

许多交换机大厂会在交换机上设置光模块白名单——只有通过认证的模块才能正常工作。白名单校验机制包括:

  • 基础信息校验:vendor name、OUI、PIN码
  • 更深入的CCBASE和Extended校验
  • 部分厂商甚至采用加密校验

一旦校验失败,交换机会采取拒绝供电、标记为unsupported、限制功能等锁定策略。

如何躲开兼容性“陷阱”?

  1. 优先选择:使用交换机厂商认证或推荐的光模块品牌
  2. 修改模块EEPROM:部分情况下可通过重写光模块的EEPROM信息绕过校验
  3. 更换模块:如果模块被锁定且无法修改,只能更换为兼容模块

光模块故障排查

在数据中心部署过程中,光模块无法Link Up很常见。建议按以下流程进行自检:

步骤
检查要点与指导
1、光纤/模块匹配性
确认单/多模匹配;光纤长度与传输模式一致
2、线缆物理状态
外观无损、无扭曲、插头清洁且卡扣完好;必要时自环测试
3、模块物理清洁/测试
金手指清洁无尘;建议两端使用相同厂商模块
4、光功率阈值
检查收发光功率是否在Threshold内;确认TX-RX未接反
5、误码率/信噪比
BER<1e-9,SNR>20db,确保信号纯净度
6、端口管理状态
查看Admin状态,Monitor-Link组关联及errdown原因
7、FEC/自协商一致性
核对两端速率、拆分模式、自协商及FEC配置镜像一致

做完以上步骤仍无法解决,大概率是兼容性问题,需要考虑更换模块品牌或联系厂商技术支持。

CMIS管理机制

CMIS(Common Management Interface Specification)是高速光模块的一种标准管理配置协议。它定义了光模块与系统管理软件之间的接口和数据格式,使得不同厂商的光模块可以通过统一的方式进行配置、监控和管理。

数字诊断监控 (DDM/DOM)

提供实时性能监测数据,包括:

  • 温度 (Temperature):模块内部温度监控
    电压 (VCC):供电电压监控
  • 光功率 (Optical Power):Tx(发射)和 Rx(接收)的实时光功率值,用于判断链路质量
  • 偏置电流 (Bias Current):激光器工作状态监测

配置与控制 (Configuration)

允许 Host 对模块进行动态配置,例如:

  • 通道速率设置:配置 Lane 的波特率和调制方式(如 PAM4)
  • 功耗控制:在不同功耗模式(Low Power vs. High Power)之间切换
  • 发射/接收控制:通过 Tx/Rx Disable 命令开关光路

状态机控制 (State Machine)

  • 定义了模块从上电到完全工作的详细生命周期(如 Reset -> Initializing -> Ready -> Operational)
  • Host 通过读取模块的“状态机”状态,可以清晰判断模块是否已准备好发送数据,或者是否遇到了故障

💡Tips:25G、100G等低速模块通常不需要CMIS配置,即插即用。但400G及以上高速模块强烈建议开启CMIS管理,否则可能遇到各种“莫名其妙”的Link Up问题。


产品型号:数据中心交换机
功能特性:RoCEv2, PFC, ECN, DCBX ……

应用场景:GPU算力集群,数据中心,分布式存储
最后更新:2026-05-26


相关文章

星融元数据技术有限公司是领先的开放网络解决方案提供商,产品包括网络操作系统、数据中心交换机、AI智算交换机、园区交换机、开放式企业级路由和新一代网络可视化产品等。为行业企业、数据中心和云运营商提供基于通用解耦硬件和 SONiC 软件框架的全场景交钥匙网络解决方案,帮助用户构建AI时代中立、透明,易于运维、高性价比的基础网络。

🔺关注 @星融元Asterfusion 微信公众号
WeChat QR Code

一文读懂 MPLS:下一代园区网络的高速转发引擎

告别VLAN堆叠与路由延迟,构建下一代多业务融合网络

MPLS文章封面

让我们设想一下:在同一张物理网络上,要同时跑通办公、安防、物联网和核心生产业务,还要保证绝对的业务隔离与极低的延时,是继续堆叠VLAN?还是靠复杂的路由策略维持?在多业务融合的狂潮下,传统IP网络有些力不从心。

改变局面的,并非什么凭空出现的新概念,而是曾经横行骨干网的“老将”——MPLS。当MPLS走下神坛进入企业园区,它究竟能为现代网络架构带来怎样的变化?

传统园区 IP 网络为何力不从心?

在探讨MPLS之前,我们需要了解当前企业网络面临的真实困境:

  • 路由查询瓶颈制约转发效率

传统IP路由采用最长前缀匹配算法。数据包在每个节点都需停下来“问路”(查表),极大地消耗了软件查找资源。效率低下成为网络高速发展的最大瓶颈。

  • VLAN 硬性数量限制导致隔离能力触底

现代园区(如高校、多租户科技园)内部业务繁杂。传统VLAN技术最多只能支持4094个网段,在面对成千上万个独立项目组或租户时,无法满足细粒度及高安全的硬性隔离需求。

  • 跨域连接与专线管理复杂

许多企业在进行多分支机构互联或混合云接入时,高度依赖物理专线,使得跨域网络的路由策略与安全边界管理变得非常繁琐。

MPLS 功能解析:“2.5层”标签交换的优势

多协议标签交换MPLS(Multiprotocol Label Switching)是一种IP骨干网技术。它的核心创新在于,在无连接的IP网络上建立了面向连接的“标签”通道,既保留了三层IP路由的灵活寻址能力,又具备了二层交换机的极简与高效

从“复杂拆包”到“极速流转”

MPLS在二层与三层头部之间插入了一个长度固定的MPLS标签,因此常被称为“2.5层”协议。

MPLS在报文中的位置

MPLS在报文中的位置

在MPLS核心网络中,设备无需剥离和解析复杂的三层 IP 头部。仅需读取定长的 MPLS 标签,即可在硬件层面完成精确、极速的“交换(Swap)”动作,彻底解决传统 IP 路由“最长前缀匹配”带来的性能瓶颈。

数据交换过程

  • Push:当IP报文进入MPLS域时,MPLS边界设备在报文二层首部和IP首部之间插入一个新标签。
  • Swap:当报文在MPLS域内转发时,根据标签转发表,用下一跳分配的标签,替换MPLS报文的栈顶标签。
  • Pop:当报文离开MPLS域时,将MPLS报文的标签剥掉。

控制平面与转发平面解耦

MPLS架构内部逻辑划分

MPLS架构的网络设备

MPLS架构将网络设备的内部逻辑划分为两层:

  1. 控制平面负责产生和维护路由及标签映射信息。
  2. 转发平面只负责实际的报文转发。

这种解耦架构确保了极高的系统稳定性——控制平面的任何计算波动,都不会影响底层数据包的高速流转。

MPLS 如何重塑园区网络体验?

除了速度上的飞跃,MPLS功能的下沉为园区网络带来了更高的性价比与坚固的安全性。

L2/L3 VPN 突破物理隔离天花板

海量业务绝对隔离

海量业务绝对隔离

借助MPLS的VPN技术(支持L2VPN的VPWS/VPLS,以及L3VPN),企业可以在同一张物理网络中,逻辑切分出成千上万个完全不可见、相互独立的虚拟网络。

这不仅满足了多部门的绝对隔离需求,更避免为了不同业务而重复购买设备与拉线,降低企业的总体拥有成本(TCO)。

精细化 QoS 与网络安全保障

精细化QoS

精细化QoS

既然一套物理网络要承载多业务,就必须确保核心业务不卡顿。MPLS方案提供了严格的优先级梯队划分:关键业务可配置零丢包保障,而低优先级业务则进行尽力转发。

PHB行为 调度策略与网络承诺 典型应用
CS7/CS6 7/6 零丢包特权保障 BGP, OSPF, IS-IS等路由协议报文及核心链路控制流量
EF 5 极低延迟与硬隔离 实时语音(VoIP)、企业跨地域4K高清双向视频会议
AF4-AF1 4/3/2/1 弹性带宽按需预留 核心ERP、数据库同步、金融交易、高价值VIP客户数据
BE 0 填补剩余资源空间 普通网页浏览(HTTP)、大文件后台传输、普通电子邮件

此外,MPLS还具备抵御篡改的安全功能,例如在LDP会话中引入MD5信令验证机制。设备间在TCP层面进行严格的密码比对,彻底杜绝黑客伪造设备身份的可能,保障全网安全。

典型的 MPLS 园区跨域应用场景

针对多分支园区的跨域互联,MPLS提供了行业标准的跨域L3VPN方案,目前主流应用为 Option A 与 Option B 两种模式:

  • Option A(背靠背VRF互联): 两端边界路由器(ASBR)之间运行普通的eBGP和IPv4协议。此方案无需中间链路支持MPLS,非常适合中间跨越第三方运营商普通专线,或园区内设备分批升级(一端支持MPLS,一端不支持)的场景,实现业务快速对接。

背靠背VRF互联

背靠背VRF互联

  • Option B(MP-BGP标签传递): 两端设备直接通过MP-BGP(多协议BGP)交换带标签的路由。无论两端划分了多少个需要隔离的部门,只需在中间建立一个BGP会话即可全部穿透对接。对于对中间设备有绝对控制权的自建跨地域网络而言,该方案扩展性极强,配置也更为简便。

MP-BGP标签传递

【MPLS 特性列表】

MPLS特性列表

值得一提的是,现代的MPLS方案正基于开放的SONiC架构平滑落地。它打破了传统设备的黑盒状态与软硬件绑定,提供业内标准的命令行界面,网络工程师无需极高的学习成本即可轻松运维。

参考产品:CX-M系列云化园区交换机:构建新一代精简高效的云化园区网络


产品型号: 星融元(Asterfusion)ET3600系列智能网关平台
支持协议:PTP,IPSec,SSL/TLS……

应用场景:企业路由器,路由器,防火墙,VPN网关,负载均衡器,IDS/IPS,网络流量分析器
最后更新:2026-05-18



产品型号: 星融元(Asterfusion)ET2500系列智能网关平台
支持协议:PTP,IPSec,SSL/TLS……

应用场景:路由器,防火墙,VPN网关,负载均衡器,IDS/IPS,网络流量分析器
最后更新:2026-05-18


相关文章

星融元数据技术有限公司是领先的开放网络解决方案提供商,产品包括网络操作系统、数据中心交换机、AI智算交换机、园区交换机、开放式企业级路由和新一代网络可视化产品等。为行业企业、数据中心和云运营商提供基于通用解耦硬件和 SONiC 软件框架的全场景交钥匙网络解决方案,帮助用户构建AI时代中立、透明,易于运维、高性价比的基础网络。

🔺关注 @星融元Asterfusion 微信公众号
WeChat QR Code

AIDC 网络运维平台全新发布:自动化极简开局、RoCE 灵活调参和网络可观测

赋能大规模智算网络的高效运维与自动化部署

AIDC网络运维

人工智能技术的快速发展正在深刻改变数据中心的建设模式。随着大模型参数迈入万亿级,算力集群规模从千卡向万卡乃至十万卡持续演进,网络互联性能成为了制约AI训练与推理效率的一大关键因素。

相比传统互联网云业务,AI 工作负载呈现出显著不同的流量特征,例如高并发通信、长时间持续的大流,以及基于 RoCE/RDMA 的低时延和高吞吐。

这些特性对数据中心网络在带宽利用率、时延控制及无损传输能力方面提出了更高要求。在此背景下,传统数据中心以设备为中心的分散式管理模式逐渐暴露出局限性。

  • 配置效率低、易出错:逐台设备手工配置,耗时费力、周期漫长,更易因人为操作失误导致网络故障,严重制约业务上线速度
  • 配置复杂,依赖个人经验:无损以太网相关参数配置(如PFC、ECN等)繁多,缺乏标准化指引,传统方式高度依赖工程师个人经验完成部署和场景调优
  • 分散管理,故障难定位:传统网络设备采用分散管理方式,缺乏统一的状态监控手段,故障发现滞后、排查链路长,影响到业务连续性

星融元 AIDC 网络运维平台

星融元 AIDC 网络运维平台专为现代 AIDC 网络打造,以集中化视角统筹全局网络资源,适配 AI 训推等高算力场景网络需求。

AIDC控制器登录界面

该平台具备直观高效的 Web 管理界面,聚焦交换机设备的集中管理与网络能力优化,提供统一的配置下发、状态监控与拓扑可视化能力,并通过自动化与策略化控制提升部署效率与运行稳定性,确保大规模网络高并发场景下的高效运行。

平台总体架构

运维平台架构

星融元 AIDC 网络运维平台基于 TIP OpenWiFi Cloud SDK 构建,采用微服务架构将系统功能划分为多个独立服务,以容器化方式部署运行,各服务通过标准接口交互,实现功能解耦与弹性扩展。

  • 北向接口层:通过直观的 Web UI 与标准化的 RESTful API,为用户提供统一、便捷的管理与操作入口,实现交互规范化。
  • 核心层:基于微服务架构,封装设备配置、固件管理、数据分析等核心能力,各服务独立运行,提升系统稳定性
  • 南向设备接入层:依托 owgw 网关服务,基于 uCentral over WebSocket 协议与交换机建立长连接,保障设备通信的实时性与可靠性。
  • 数据存储:采用 PostgreSQL 数据库实现配置数据与设备状态数据的集中、持久化存储,支持高效的查询与事务处理。

功能1: 业务快速部署和开局

星融元 AIDC 网络运维平台通过自动化部署与模板化编排能力,完成从设备接入、拓扑规划到配置下发的全流程简化,显著提升网络开局效率。

设备自动上线入库

在管理界面中,创建专属的物理场所(如“AIDC-xx”),用户可通过 CSV 文件批量导入设备的MAC地址、型号与命名信息,在平台内建立设备资源库信息。

设备上架上电,并配置网络运维平台IP地址后,将自动通过 WebSocket 与平台建立连接,进入设备资源库等待分配。

设备自动上线入库

多场景网络拓扑模板

平台内置了多场景的标准场景模板,预集成对应的网络结构与关键特性,用户可基于模板快速完成网络规划与部署。此外,用户也可导入本地预先规划的拓扑文件,无需从零开始构建。

多场景网络拓扑模版

  • AIDC 后端网络(GPU训练网络) :采用 Spine-Leaf 架构,支持大规模节点接入,并集成RoCE、智能选路及ARS(自适应路由切换)等能力,以满足高带宽、低时延及无损传输需求。
  • AIDC 前端网络(业务管理网络):基于 EVPN MC-LAG 技术实现链路冗余与业务隔离,保障业务接入的高可靠性。
  • AIDC存储网络(存储后端网络):结合分布式网关、MC-LAG及RoCE技术,提升存储访问性能与可靠性。
  • DC融合网络:支持基于 EVPN MC-LAG或 EVPN Multihoming 的典型组网方式,适用于传统数据中心业务场景。

该界面同时支持用户手动编辑,为交换机设备分配具体角色,并配置设备间的互联链路参数。

互联链路参数

拓扑一致性自动校验

设备上线后,网络运维平台能够自动发现设备间的链路关系,生成真实网络拓扑。用户可一键执行“拓扑一致性验证”,扫描真实网络拓扑并与规划拓扑比对,精准识别物理连线错误,确保规划方案与实际部署完全一致。

拓扑校验

分步批量下发配置

该阶段采用“先基础网络、后业务配置”的分步下发策略,有序完成网络打通与业务加载。以AI智算训练网络为例主要有以下流程:

  • 建立基础连接:自动建立BGP邻居,用户无需为互联口手动规划IP地址;Spine交换机宣告各 Rail 网段路由,实现全网互通,BGP Peer-group 批量下发,向全网设备推送基础网络配置,等待状态同步完成即可进入业务配置阶段

建立基础连接

  • 启用RoCE功能:选择适配业务场景的RoCE模板,匹配无损网络必备的 PFC/ECN 策略,为低时延通信提供支撑

启动RoCE

功能2:RoCE 参数模板化配置和灵活调优

在AI数据中心网络中,RoCE相关参数 (如PFC、ECN) 的配置对网络性能具有重要影响。然而,不同业务场景下对时延、吞吐及拥塞控制的要求存在差异,若完全依赖人工逐项配置,不仅复杂度高,也难以保证参数组合的合理性。

星融元 AIDC 网络运维平台采用“模板化配置+参数微调”的方式,来帮助用户实现面向多场景的 RoCE 网络高效部署与精细优化。

基于场景的RoCE配置模板

平台内置多种面向典型 AI 业务场景的 RoCE 参数模板,预定义 PFC 优先级、ECN 标记策略等关键参数组合。用户可根据业务类型选择合适模板,快速完成网络基础配置,降低参数配置复杂度。

RoCE 参数动态调优

在模板基础上,平台支持对 PFC、ECN 等关键网络参数进行实时微调,无需中断业务即可适配流量负载的动态变化,保障数据传输的低延迟与高稳定性。

RoCE参数调优

RoCE参数调优

功能3:设备集中管控和运维

AIDC网络运维平台面向大规模数据中心网络,通过集中化管控与可观测体系,提升网络运维效率并降低人工操作复杂度。

一站式纳管

交换机设备上线后自动纳入平台统一管理,并进入默认资源池(组织)。

管理员可根据实际部署需求,将设备批量划分到指定场所或业务域,并在一处位置集中完成对指定设备的配置下发与修改、配置文件统一管理(查看、导入、导出)、远程命令执行与自动化脚本下发和其他运维操作(重启、升级等)。

一站式纳管

网络可观测性

设备运行状态和接口流量

呈现交换机设备层的健康度,例如交换机CPU利用率、内存使用率及接口运行状态等硬件基础信息,以及实时/历史的交换机接口和队列收发速率、带宽利用率,并精准统计各类丢包误包数据,为网络带宽规划、异常流量排查提供数据支撑。

设备运行状态和接口流量

业务运行状态

提供网络中 VLAN、RoCE、ARS 等核心业务的详细状态概览,整合关联接口、配置参数与实时运行状态,帮助管理员洞察业务层的健康度。

业务运行状态

无损网络信息统计

交换机上 PFC帧、ECN 标记与丢包及RDMA流量统计,实时监控各队列 Buffer 资源使用情况,预警拥塞。

无损网络信息统计

光模块工作状态

实时采集光模块温度、电压、收发功率及告警状态等关键指标。对功率衰减、温度异常进行提前预警。

光模块工作状态

实时告警和智能巡检

网络运维平台提供基于监控数据的告警与巡检机制,提升网络运行的稳定性与可维护性。告警机制支持自定义告警阈值与通知策略,实现对设备状态、资源利用率及硬件运行状态的实时监控与告警。

实时告警和智能巡检

实时告警和智能巡检

平台支持一键巡检及周期性巡检,对设备关键指标 (如CPU、内存、进程状态及日志) 进行自动检查,并生成巡检报告。

多组织和权限管理

网络运维平台支持多组织架构,可按照地域、部门或业务进行分级管理,不同管理员可在各自权限范围内进行操作。

多组织和权限管理

系统迁移和配置复用

平台支持对系统配置进行整体导出与导入,例如在系统扩容、迁移部署及灾备恢复时,管理员可一键导出当前平台配置,并在目标平台中进行导入,减少重复配置工作。

系统迁移和配置复用

交换机产品系列

当前 AIDC 网络运维平台已全面支持星融元 AIDC 交换机产品 —— CX-N 系列

星融元(Asterfusion)CX-N系列数据中心交换机面向智算中心和云计算数据中心提供一站式全开放网络解决方案,具备低时延、高性能、高密度等特性。其依托业界领先的超低时延交换芯片,采用先进的硬件架构设计,提供高密度25GE~800GE端口,充分满足用户多样化的端口接入需求。

运行在CX-N交换机之上的 AsterNOS,是星融元为智算中心和云计算数据中心设计开发的开放网络操作系统。

本产品全系列标配RoCE特性,并基于用户生产网络进行优化,提供了EasyRoCE、智能负载均衡、PFC/ECN等无损网络特性,并集成了VXLAN、EVPN等丰富的数据中心特性。


产品型号: 星融元(Asterfusion)CX864E-N (64 x 800G OSFP)
功能特性:RoCEv2, PFC, ECN, DCBX ……
应用场景:GPU算力集群,分布式存储
最后更新:2026-05-18


相关文章

星融元数据技术有限公司是领先的开放网络解决方案提供商,产品包括网络操作系统、数据中心交换机、AI智算交换机、园区交换机、开放式企业级路由和新一代网络可视化产品等。为行业企业、数据中心和云运营商提供基于通用解耦硬件和 SONiC 软件框架的全场景交钥匙网络解决方案,帮助用户构建AI时代中立、透明,易于运维、高性价比的基础网络。

🔺关注 @星融元Asterfusion 微信公众号
WeChat QR Code

为什么你的时钟精度不够用了?一文读懂PTP(IEEE 1588)的绝对掌控力

从底层逻辑到行业实战,深度解析 IEEE 1588 精确时间协议

PTP

在这个万物互联、数据井喷的数字时代,绝大多数人都在关注“带宽有多大”、“网速有多快”。 但很少有人注意到,那些我们早已习以为常的日常生活瞬间——比如看电视时音画完美的对齐、用5G手机时流畅不卡顿的体验——其实都依赖于一个隐藏在幕后的终极尺度。在这些触手可及的便捷背后,正悄悄上演着一场决定全网生死的“时间精度”保卫战。

今天,就让我们一起深度解密这项让万千设备实现“灵魂同步”的隐形硬核技术——PTP(IEEE 1588 精确时间协议)。

什么是PTP?为什么传统的NTP不够用了?

PTP(Precision Time Protocol,精确时间协议),又称 IEEE 1588 协议。它是一种通过以太网络为主从设备提供“亚微秒级”乃至“纳秒级”时钟同步的底层标准协议。

很多人会问:我们熟知的 NTP(网络时间协议) 不是已经用了几十年了吗?为什么还要发明 PTP?原因就在于应用层和物理层的精度鸿沟:

NTP(毫秒级精度,10⁻³s)

NTP 主要基于系统的软件应用层运行。

当数据包在操作系统内部排队、通过CPU处理时,会产生极大的、不可控的软件时延。这种精度用来对齐电脑网页时间、看新闻绰绰有余,但面对高精度的时间同步需求时则彻底无能为力。

PTP(微秒/纳秒级精度,10⁻⁶s 至 10⁻⁹s)

PTP 最大的底层技术变革在于硬件打时间戳(Hardware Timestamping)。

PTP 数据包在刚踏入交换机物理层端口(PHY/MAC)的瞬间,就会被牢牢盖上带有当前时间戳的“物理烙印”,绕过了复杂的应用层操作系统和CPU排队带来的抖动。

场景 精度要求 失步影响
5G基站时间同步 相邻基站时间差<1.5微秒 手机信号频繁断连、打游戏网络瞬时雪崩、基站间产生严重的无线信号互相干扰
金融高频交易 交易时间戳对齐 < 1微秒 交易先后顺序混淆,引发“时间倒流”式的恶意套利,导致金融监管彻底失效
音视频制播网络 专业音视频流误差<1微秒 电视直播音画不同步(对不上口型)、切换画面时闪黑屏、视频画面出现物理撕裂

PTP 如何选择主时钟与同步时间?

在一张拥有成百上千台设备的大型网络中,PTP 是如何有条不紊地工作,又是如何保证时间数据不会发生混乱的呢?

规则确立:BMCA算法如何选择时钟源头

在一个 PTP 域内,如此多的网络设备,谁来当规则的制定者?

所有PTP设备会通过BMCA(Best Master Clock Algorithm)算法进行一场全自动的、极其严谨的“能力比拼”。设备间通过互相发送含有自身时钟信息的 Announce报文,按照以下指标优先级由高到低进行绝对对决:

Priority 1(优先级1) → Clock Class(时钟级别) → Clock Accuracy(时钟精度) → Priority 2(优先级2) → MAC地址(最终兜底)

当外接 GNSS 卫星信号正常锁定的时候,主设备会展现出最高级别的时钟数值。一旦该主设备(Grandmaster)意外宕机,全网设备会利用 BMCA 算法在毫秒级别内自动海选出“备选”主时钟,整个切换过程对于业务层完全透明,确保全网时钟绝不断流。

各司其职:PTP网络中的四大时钟角色

竞选出了最准的绝对时间源头之后,整个时间网络还需要不同层级的设备协同配合。在 PTP 的世界里,设备主要被赋予了四种不同的时钟角色:

PTP网络中的四大时钟角色

GM(Grandmaster,主时钟):作为全网绝对的时间源头,通常通过 GNSS 接口直接连接卫星获取精确时间。

BC(Boundary Clock,边界时钟):它是整张网络中最重要的角色之一 。BC 的其中一个端口作为从端口(Slave Port)与上级时钟源保持同步,而其余端口则作为主端口(Master Port)向下一级设备分发时钟。BC 能够有效终止上游网络引入的包时延变动与累积抖动,作为时延隔离墙重新生成纯净的物理层硬件时间戳,同时利用硬件打戳机制动态计算并补偿双向链路的非对称性传输时延,极大地降低了时钟级联过程中的精度衰减。

TC(Transparent Clock,透明时钟):TC 节点本身不参与时钟源的层级同步。当 PTP 协议报文流经该节点时,硬件物理层会计算报文在设备内部的进出端口时间差,即驻留时间。TC 会将该驻留时间精确累加至 PTP 报文头部的Correction Field中,从而使得最终的从时钟端能够完全扣除中间网络设备的排队与调度抖动。

OC(Ordinary Clock,普通时钟):仅具备单一 PTP 物理端口的终端节点。通常作为网络的终点(如5G基站的RU 、广电的摄像机),只负责严丝合缝地接收并执行对齐后的时间。

尺规对齐:双向报文时延测算系统(以最常用的 E2E 模式为例)

E2E模式

选出主时钟(Master)后,从时钟(Slave)如何实时纠正自己与主时钟的偏差?

PTP 巧妙地通过四种协议报文中携带硬件打戳时间(t1、t2、t3、t4)让slave能够进行初中数学级别的公式推导,得出自己与主时钟的时钟偏差,以及传输路径上的时延:

  1. Master 发送 Sync 报文,并在离开端口时记下硬件时间 t1。Slave 收到该报文,记下收到时间t2。
  2. (可选) Master 发送 Follow_Up 报文,将精确的 t1 数值告诉 Slave。
  3. Slave 主动向 Master 发送 Delay_Req 报文,记下离开时间 t3。Master 收到该报文,记下收到 时间 t4。
  4. Master 回复 Delay_Resp 报文,将 t4 告诉 Slave。

此时,Slave 手中同时握有了 t1、t2、t3、t4 四个时间点。假设网络双向路径对称,通过公式即可轻松算出:

t2-t1 = offset + path delay —> path delay = (t2-t1)+(t4-t3)/2 t4-t3 = path delay – offset —> offset = (t2-t1)-(t4-t3)/2

得到了offset和patch delay这两个关键指标,从时钟的本地伺服晶振就会将本地时钟调整为:本地时间+与主时钟的偏差(offset) + 路径上的转发时延(path delay),实现与主时钟的完美对齐。

落地实战:PTP如何解决行业痛点?

5G O-RAN 开放式无线接入网前传场景

在开放式的 5G O-RAN 架构中,一体化基站被拆分为 O-CU、O-DU 和 O-RU(天线单元)。为了降低天线端的硬件成本并支持大规模天线技术(Massive MIMO Cat B 架构),原本复杂的波束赋形计算被下沉到了最边缘的 O-RU 物理天线端。

这就带来了一个物理级别的极限挑战:多根天线在空中发射空间波束时,如果彼此之间的时序偏差超过100 纳秒,波束的能量聚焦就会在中途发生错位甚至互相抵消,直接导致手机信号断连、速率雪崩、TDD上下行时隙冲突引起严重的基站互干扰。

而拆分后的各个单元之间,又必须保障高精度的时间同步,才能实现灵活的资源调度与功能部署。

5G 前传网络引入了 ITU-T G.8275.1(全面定时支持) 和 G.8275.2(部分定时支持) 电信级Profile。

SyncE + PTP (1+1>2)

超高清广播电视网络

广电全行业全面IP化以来,视频流(ST 2110-20)、音频流(ST 2110-30)和辅助数据(ST 2110-40)被彻底拆分成独立的以太网RTP数据包进行传输。在庞大的交换机网络中,这三个流走不同的路径、产生不同的排队,到了接收端如果没有统一的“时序烙印”,就会发生严重的音画不同步、视频画面撕裂、切换闪黑屏。

广电行业引入了基于 PTP 的 SMPTE ST 2059-2 Profile。

  • 顶层时钟源(GM主时钟):时钟源通常采用由卫星(GNSS)锁定的铷时钟等极其专业的母钟设备作为Grandmaster。为了应对重大直播等极端严苛的安全要求,广电网络通常会部署多个专业的时钟源进行双主或多主备份。通过 BMCA(最佳主时钟算法),多台主钟在底层保持热备,一旦主用时钟发生微弱异常,备用主钟会在毫秒级内无缝接管,业务层零感知。
  • 网络交换机(BC边界时钟):广播电视网中的核心与汇聚交换机开启BC模式。它们从顶层高精度铷时钟获取绝对时间,并在将时间分发给下游设备时。
  • 终端设备(Slave):摄像机、调音台、非编系统等终端设备作为从时钟,严丝合缝地对齐网络时间。每一帧视频和每一段音频包在进入网络前,都被烙上了绝对时间的“生产日期”。

终端设备(Slave)

软硬兼备:星融元PTP交换机产品矩阵

为了在复杂多变的工业与电信现网环境中落地如此完美的纳秒级体验,星融元依托自研的高性能网络操作系统 AsterNOS 以及硬核的硬件架构,推出了覆盖全速率的 PTP 交换机矩阵。

PTP交换机产品矩阵


产品型号:云化园区交换机
功能特性:DHCP Snooping,动态ARP检测,ND Snooping,IPSGv4/v6,PTP……
应用场景:校园网,企业网,分布式网关,网络接入认证……
最后更新:2026-07-13



产品型号: 星融元(Asterfusion)ET3600系列智能网关平台
支持协议:PTP,IPSec,SSL/TLS……

应用场景:企业路由器,路由器,防火墙,VPN网关,负载均衡器,IDS/IPS,网络流量分析器
最后更新:2026-07-13



产品型号: 星融元(Asterfusion)ET2500系列智能网关平台
支持协议:PTP,IPSec,SSL/TLS……
应用场景:路由器,防火墙,VPN网关,负载均衡器,IDS/IPS,网络流量分析器
最后更新:2026-07-13


相关文章

星融元数据技术有限公司是领先的开放网络解决方案提供商,产品包括网络操作系统、数据中心交换机、AI智算交换机、园区交换机、开放式企业级路由和新一代网络可视化产品等。为行业企业、数据中心和云运营商提供基于通用解耦硬件和 SONiC 软件框架的全场景交钥匙网络解决方案,帮助用户构建AI时代中立、透明,易于运维、高性价比的基础网络。

🔺关注 @星融元Asterfusion 微信公众号
WeChat QR Code

面向 AIDC 的数字孪生:基于vAsterNOS对星融元开放网络的全数字化模拟

零硬件投入,高保真还原真实网络拓扑与配置效果

数字孪生 封面图

在网络架构演进与技术升级过程中,智算/数据中心网络面临着高成本与高风险的双重挑战,上层业务的复杂化对网络性能与协议提出了更高要求。

为满足灵活多变的业务需求,运维团队需不断优化网络架构和相关配置。然而,传统物理测试环境的搭建受限于昂贵的设备与时间投入,在缺乏预验证手段的情况下,直接在现网实施配置调整或架构改造极易引发业务中断。

针对上述挑战,我们推出了适用于星融元智算/云数据中心网络产品的数字孪生网络方案:客户可基于开源、开放的网络技术,在自有环境下预先构建一套全数字化模拟的孪生网络,在真实物理网络部署和改造之前,预先验证网络规划和交换机配置效果,从而提高创新效率,降低试错成本。

数字孪生

零硬件成本

通过纯软件的虚拟化部署消除设备采购与物理搭建开支,提供零硬件成本的模拟环境用于组网方案验证和设备操作练习。

零工具成本

星融元 vAsterNOS 镜像面向签约用户免费提供,无缝适配主流平台如 GNS3 和 EVE-NG,依托开放生态避免商业仿真工具高昂的授权与维护费用。

提升网络创新与验证效率

灵活、弹性地构造虚拟拓扑来支持操作系统新版本特性的应用,显著缩短网络方案从设计到上线的验证周期。

星融元数字孪生网络方案组成

本方案主要由虚拟化平台与 vAsterNOS 网络操作系统镜像两部分组件构成,通过软硬件环境的解耦,实现网络拓扑的数字化模拟仿真。

网络拓扑数字化模拟仿真

尽管数字孪生网络与真正物理网络存在不可忽视的底层硬件差异,但vAsterNOS具备与星融元交换机上运行的开放网络操作系统(AsterNOS)高度一致的控制面与协议栈,可支持模拟和验证交换机的控制面协议与功能配置逻辑

虚拟化平台

本方案推荐采用 GNS3 作为网络设备模拟与测试平台。GNS3 是一款开源的图形化网络模拟软件,支持多种网络操作系统镜像的导入与运行,可用于高保真地复刻和搭建复杂的数字孪生网络拓扑。

在实际部署中,GNS3平台采用典型的客户端/服务端架构:

  • 服务端部署:推荐将 GNS3 服务端(Server)安装在独立的远程服务器上,以保障虚拟设备运行所需的 CPU 和内存资源;若本地 PC 配置满足性能要求,亦可直接在本地安装。
  • 客户端部署:用户在本地计算机上安装 GNS3 客户端(Client),用于图形化界面的远程拓扑编排与虚拟设备控制。为简化部署操作,星融元提供了 All-in-One 整合程序,帮助用户快速完成环境初始化。

有关 GNS3 平台的具体安装方式与系统要求,请参考 GNS3 官方指导文档: (https://docs.gns3.com/docs/)。

vAsterNOS 网络操作系统镜像

作为星融元数字孪生网络的核心组成,vAsterNOS可运行在GNS3、EVE-NG等网络虚拟软件中(推荐配置不低于2 个 vCPU 和 4GB RAM)。本方案涉及的vAsterNOS版本和主要软件特性如下。

vAsterNOS – Data Center (面向智算/数据中心场景):

支持RoCEv2无损网络,EasyRoCE, 自适应路由切换(ARS),VXLAN, BGP EVPN, OSPF v2/v3, VRF, MC-LAG等,提供丰富的管理面可编程接口(REST API/ NETCONF /gNMI)对接第三方管理平台和自动化运维工具。

AsterNOS网络操作系统架构图

AsterNOS的最新版本通常会以季度为周期同步到vAsterNOS,最新的完整软件功能可参考版本特性清单,请联系星融元售前技术人员获取。

软件资源下载

本方案涉及的所有平台软件、设备模板及操作系统镜像均已归档至星融元企业网盘,用户在星融元官网注册登录后即可自行下载。地址:https://asterfusion.com/product/vasternos/#vAsterNOS-download

签约客户可直接联系星融元工作人员或项目经理索取专属下载通道及配套资料,同时欢迎广大意向客户拨打400-098-9811 热线咨询获取相关技术支持。

类别 项目 说明
核心平台组件 GNS3 VM Server 服务端虚机镜像,部署于远程服务器(ESXi/VMware),承载虚拟设备运行
GNS3 VM Client 本地客户端安装包,安装于用户个人电脑,用于远程连接服务端并编排网络拓扑。
系统镜像 vAsterNOS 虚拟化版本的AsterNOS网络操作系统镜像(.img./bin/.gz),内含多个历史版本供用户按需选用。
辅助组件 vAsterNOS 模板 GNS3设备模板文件,预定义虚拟设备参数与运行环境,用于快速导入网络节点。
vAsterNOS 图标 拓扑节点矢量图标,用于在GNS3图形化界面中呈现星融元设备的专属视觉标识。
其他相关软件 Centos 7.6 Linux系统轻量化镜像,可导入虚拟化平台作为网络拓扑中的测试终端或主机
EVE-NG EVE-NG社区版服务端虚机镜像,作为备选的网络虚拟化模拟平台,部署于虚机环境。

产品型号:数据中心交换机
功能特性:RoCEv2, PFC, ECN, DCBX ……

应用场景:GPU算力集群,数据中心,分布式存储
最后更新:2026-05-26


相关文章

星融元数据技术有限公司是领先的开放网络解决方案提供商,产品包括网络操作系统、数据中心交换机、AI智算交换机、园区交换机、开放式企业级路由和新一代网络可视化产品等。为行业企业、数据中心和云运营商提供基于通用解耦硬件和 SONiC 软件框架的全场景交钥匙网络解决方案,帮助用户构建AI时代中立、透明,易于运维、高性价比的基础网络。

🔺关注 @星融元Asterfusion 微信公众号
WeChat QR Code

EasyRoCE 上新:RoCE网卡参数配置工具

告别低效的手动运维,星融元EasyRoCE-NC助您轻松完成网卡批量部署。

EasyRoCE-NE 封面图

智算中心场景中,GPU分布式训练的性能很大程度取决于底层网络的通信效率,其中RoCE网络对网卡参数配置的一致性、准确性要求极高,配置偏差会直接引发网络丢包、拥塞死锁、训练性能骤降甚至任务中断。

手动配置难以为继

  • 传统手动配置方式在智算集群运维中存在很多痛点,难以适配大规模集群的管理需求:
  • 效率极低:数百台规模的集群需运维人员逐台登录服务器配置,费时费力
  • 一致性差:人工配置失误导致集群RoCE配置不统一,引发网络性能不均,且问题定位难度极大
  • 无环境预检:配置前无法批量验证服务器驱动、固件和RDMA组件的完整性,导致配置中途频繁失败
  • 缺乏持久化保障:手动配置没有标准化开机自启方案,一旦服务器重启后配置丢失,需要低效的重复操作

网卡参数配置工具 EasyRoCE-NC

星融元 EasyRoCE Toolkit 新推出的网卡参数配置工具(Network Configurator,NC)专为智算中心网络打造,通过实现规模集群 RoCE 网卡的一键式配置,解决上述传统运维方式带来的核心痛点。

  • 标准化配置:基于统一规划,一键完成全集群RoCE网卡参数配置,保证集群服务器参数一致
  • 环境预检:配置前自动完成集群网卡环境检查,提前规避风险
  • 低门槛易操作:无需运维人员精通RoCE底层技术,一键执行即可完成配置,降低运维门槛
  • 支持配置持久化:根据需求选择RoCE配置是否持久化,避免服务器重启后配置丢失

实现原理

NC 工具通过从数据源(EasyRoCE-AID工具,AI基础设施蓝图)中自动解析到集群服务器网卡规划与RoCE参数,完成网卡环境预检、标准化配置脚本生成和批量执行动作。

此外,NC工具可与EasyRoCE-UG平台无缝打通。配置完成后即可通过 NE、TM、TG、DP 等组件(参阅开源开放生态下的RDMA网络监控实践),实现网卡状态、光模块健康、网络拓扑和交换机硬件的全维度可视化监控。

RoCE网卡参数配置工具的实现原理

安装步骤概览与效果

环境和工具准备

1、服务器要求

NC工具运行在集群的监控服务器上,该服务器需安装 Mellanox OFED 版本驱动,驱动与网卡固件版本匹配,已开启SSH服务并配置免密登录,管理网IP与监控节点网络互通。

2、数据源

NIC Configurator(NC) 工具以 EasyRoCE-AID 为核心数据源,用户需提前在服务器上安装该工具,并按用户指导文档修改文件路径和名称。

[root@server1 EasyRoCE]# cat config.ini 
[GRAFANA]
GRAFANA_URL =
API_KEY =
DIRECTORY_NAME = 
[COMMANDS]
AID_path = /root/EasyRoCE
AID_file = EasyRoCE-AID-v1.8.xlsm
prometheus_uid = 

3、NIC Configurator (NC)工具包

用户可通过星融元官网EasyRoCE:网卡参数配置(NC)或项目销售人员获取最新版本NC工具包。

安装NC工具

将NC工具包上传到监控服务器的EasyRoCE工具目录下。解压后,执行EasyRoCE-NC.py启动脚本即可完成配置和环境预检(配置失败的GPU服务器会跳过,并告知未通过项)。

 [root@localhost EasyRoCE-NC]# python3 EasyRoCE-NC.py 
文件路径:./roce_server_config.json
成功生成 2 台服务器的配置
============================================================
开始环境预检,共 2 台服务器(并发数: 10)
============================================================
❌GPU-Server02: 未通过项: 
ib_dev:mlx5_10, ib_dev:mlx5_12, netdev_map:mlx5_10, netdev_map:mlx5_12
ib_dev:mlx5_10: mlx5_10 不在 /sys/class/infiniband/,当前设备: 无
⚠ib_dev:mlx5_12: mlx5_12 不在 /sys/class/infiniband/,当前设备: 无
⚠netdev_map:mlx5_10: mlx5_10 在 ibdev2netdev 输出中无映射,脚本执行时将跳过该设备
⚠netdev_map:mlx5_12: mlx5_12 在 ibdev2netdev 输出中无映射,脚本执行时将跳过该设备
✅GPU-Server01 (10.230.1.12): 所有检查通过

============================================================
❌ 预检未通过,以下服务器存在问题:
-GPU-Server02
请修复上述问题后重新运行
============================================================ 

最终效果

正确完成 NC 工具的上述安装配置流程,并协同 EasyRoCE-NE工具(网卡状态采集),用户就可在EasyRoCE-UG 监控面板上直观地查看集群服务器集群网卡的详细信息。

 监控面板上展示的网卡配置与状态采集协同运行。


产品型号: 星融元(Asterfusion)CX864E-N (64 x 800G OSFP)
功能特性:RoCEv2, PFC, ECN, DCBX ……
应用场景:GPU算力集群,分布式存储
最后更新:2026-05-18



产品型号: 星融元(Asterfusion)CX664D-N(64 x 200G QSFP56/QSFP28/QSFP+)
功能特性:RoCEv2, PFC, ECN, DCBX ……

应用场景:分布式存储,数据中心,GPU算力集群
最后更新:2026-05-26


相关文章

星融元数据技术有限公司是领先的开放网络解决方案提供商,产品包括网络操作系统、数据中心交换机、AI智算交换机、园区交换机、开放式企业级路由和新一代网络可视化产品等。为行业企业、数据中心和云运营商提供基于通用解耦硬件和 SONiC 软件框架的全场景交钥匙网络解决方案,帮助用户构建AI时代中立、透明,易于运维、高性价比的基础网络。

🔺关注 @星融元Asterfusion 微信公众号
WeChat QR Code

对星融元产品感兴趣?

立即联系!

返回顶部

© 星融元数据技术(苏州)有限公司 苏ICP备17070048号-2