AIDC 网络运维平台全新发布:自动化极简开局、RoCE 灵活调参和网络可观测
赋能大规模智算网络的高效运维与自动化部署
人工智能技术的快速发展正在深刻改变数据中心的建设模式。随着大模型参数迈入万亿级,算力集群规模从千卡向万卡乃至十万卡持续演进,网络互联性能成为了制约AI训练与推理效率的一大关键因素。
相比传统互联网云业务,AI 工作负载呈现出显著不同的流量特征,例如高并发通信、长时间持续的大流,以及基于 RoCE/RDMA 的低时延和高吞吐。
这些特性对数据中心网络在带宽利用率、时延控制及无损传输能力方面提出了更高要求。在此背景下,传统数据中心以设备为中心的分散式管理模式逐渐暴露出局限性。
- 配置效率低、易出错:逐台设备手工配置,耗时费力、周期漫长,更易因人为操作失误导致网络故障,严重制约业务上线速度
- 配置复杂,依赖个人经验:无损以太网相关参数配置(如PFC、ECN等)繁多,缺乏标准化指引,传统方式高度依赖工程师个人经验完成部署和场景调优
- 分散管理,故障难定位:传统网络设备采用分散管理方式,缺乏统一的状态监控手段,故障发现滞后、排查链路长,影响到业务连续性
星融元 AIDC 网络运维平台
星融元 AIDC 网络运维平台专为现代 AIDC 网络打造,以集中化视角统筹全局网络资源,适配 AI 训推等高算力场景网络需求。
该平台具备直观高效的 Web 管理界面,聚焦交换机设备的集中管理与网络能力优化,提供统一的配置下发、状态监控与拓扑可视化能力,并通过自动化与策略化控制提升部署效率与运行稳定性,确保大规模网络高并发场景下的高效运行。
平台总体架构
星融元 AIDC 网络运维平台基于 TIP OpenWiFi Cloud SDK 构建,采用微服务架构将系统功能划分为多个独立服务,以容器化方式部署运行,各服务通过标准接口交互,实现功能解耦与弹性扩展。
- 北向接口层:通过直观的 Web UI 与标准化的 RESTful API,为用户提供统一、便捷的管理与操作入口,实现交互规范化。
- 核心层:基于微服务架构,封装设备配置、固件管理、数据分析等核心能力,各服务独立运行,提升系统稳定性
- 南向设备接入层:依托 owgw 网关服务,基于 uCentral over WebSocket 协议与交换机建立长连接,保障设备通信的实时性与可靠性。
- 数据存储:采用 PostgreSQL 数据库实现配置数据与设备状态数据的集中、持久化存储,支持高效的查询与事务处理。
功能1: 业务快速部署和开局
星融元 AIDC 网络运维平台通过自动化部署与模板化编排能力,完成从设备接入、拓扑规划到配置下发的全流程简化,显著提升网络开局效率。
设备自动上线入库
在管理界面中,创建专属的物理场所(如“AIDC-xx”),用户可通过 CSV 文件批量导入设备的MAC地址、型号与命名信息,在平台内建立设备资源库信息。
设备上架上电,并配置网络运维平台IP地址后,将自动通过 WebSocket 与平台建立连接,进入设备资源库等待分配。
多场景网络拓扑模板
平台内置了多场景的标准场景模板,预集成对应的网络结构与关键特性,用户可基于模板快速完成网络规划与部署。此外,用户也可导入本地预先规划的拓扑文件,无需从零开始构建。
- AIDC 后端网络(GPU训练网络) :采用 Spine-Leaf 架构,支持大规模节点接入,并集成RoCE、智能选路及ARS(自适应路由切换)等能力,以满足高带宽、低时延及无损传输需求。
- AIDC 前端网络(业务管理网络):基于 EVPN MC-LAG 技术实现链路冗余与业务隔离,保障业务接入的高可靠性。
- AIDC存储网络(存储后端网络):结合分布式网关、MC-LAG及RoCE技术,提升存储访问性能与可靠性。
- DC融合网络:支持基于 EVPN MC-LAG或 EVPN Multihoming 的典型组网方式,适用于传统数据中心业务场景。
该界面同时支持用户手动编辑,为交换机设备分配具体角色,并配置设备间的互联链路参数。
拓扑一致性自动校验
设备上线后,网络运维平台能够自动发现设备间的链路关系,生成真实网络拓扑。用户可一键执行“拓扑一致性验证”,扫描真实网络拓扑并与规划拓扑比对,精准识别物理连线错误,确保规划方案与实际部署完全一致。
分步批量下发配置
该阶段采用“先基础网络、后业务配置”的分步下发策略,有序完成网络打通与业务加载。以AI智算训练网络为例主要有以下流程:
- 建立基础连接:自动建立BGP邻居,用户无需为互联口手动规划IP地址;Spine交换机宣告各 Rail 网段路由,实现全网互通,BGP Peer-group 批量下发,向全网设备推送基础网络配置,等待状态同步完成即可进入业务配置阶段
- 启用RoCE功能:选择适配业务场景的RoCE模板,匹配无损网络必备的 PFC/ECN 策略,为低时延通信提供支撑
- VLAN与网关规划:为各 Rail 分配独立 VLAN 段及网关 IP,实现业务的逻辑隔离
- 启用自适应路由切换(ARS):感知链路拥塞,将流分割为 Flowlet,动态选择最佳路由路径。参阅:一文看懂ARS(自适应路由切换):基于 Flowlet 的动态负载均衡技术
功能2:RoCE 参数模板化配置和灵活调优
在AI数据中心网络中,RoCE相关参数 (如PFC、ECN) 的配置对网络性能具有重要影响。然而,不同业务场景下对时延、吞吐及拥塞控制的要求存在差异,若完全依赖人工逐项配置,不仅复杂度高,也难以保证参数组合的合理性。
星融元 AIDC 网络运维平台采用“模板化配置+参数微调”的方式,来帮助用户实现面向多场景的 RoCE 网络高效部署与精细优化。
基于场景的RoCE配置模板
平台内置多种面向典型 AI 业务场景的 RoCE 参数模板,预定义 PFC 优先级、ECN 标记策略等关键参数组合。用户可根据业务类型选择合适模板,快速完成网络基础配置,降低参数配置复杂度。
RoCE 参数动态调优
在模板基础上,平台支持对 PFC、ECN 等关键网络参数进行实时微调,无需中断业务即可适配流量负载的动态变化,保障数据传输的低延迟与高稳定性。
功能3:设备集中管控和运维
AIDC网络运维平台面向大规模数据中心网络,通过集中化管控与可观测体系,提升网络运维效率并降低人工操作复杂度。
一站式纳管
交换机设备上线后自动纳入平台统一管理,并进入默认资源池(组织)。
管理员可根据实际部署需求,将设备批量划分到指定场所或业务域,并在一处位置集中完成对指定设备的配置下发与修改、配置文件统一管理(查看、导入、导出)、远程命令执行与自动化脚本下发和其他运维操作(重启、升级等)。
网络可观测性
设备运行状态和接口流量
呈现交换机设备层的健康度,例如交换机CPU利用率、内存使用率及接口运行状态等硬件基础信息,以及实时/历史的交换机接口和队列收发速率、带宽利用率,并精准统计各类丢包误包数据,为网络带宽规划、异常流量排查提供数据支撑。
业务运行状态
提供网络中 VLAN、RoCE、ARS 等核心业务的详细状态概览,整合关联接口、配置参数与实时运行状态,帮助管理员洞察业务层的健康度。
无损网络信息统计
交换机上 PFC帧、ECN 标记与丢包及RDMA流量统计,实时监控各队列 Buffer 资源使用情况,预警拥塞。
光模块工作状态
实时采集光模块温度、电压、收发功率及告警状态等关键指标。对功率衰减、温度异常进行提前预警。
实时告警和智能巡检
网络运维平台提供基于监控数据的告警与巡检机制,提升网络运行的稳定性与可维护性。告警机制支持自定义告警阈值与通知策略,实现对设备状态、资源利用率及硬件运行状态的实时监控与告警。
平台支持一键巡检及周期性巡检,对设备关键指标 (如CPU、内存、进程状态及日志) 进行自动检查,并生成巡检报告。
多组织和权限管理
网络运维平台支持多组织架构,可按照地域、部门或业务进行分级管理,不同管理员可在各自权限范围内进行操作。
系统迁移和配置复用
平台支持对系统配置进行整体导出与导入,例如在系统扩容、迁移部署及灾备恢复时,管理员可一键导出当前平台配置,并在目标平台中进行导入,减少重复配置工作。
交换机产品系列
当前 AIDC 网络运维平台已全面支持星融元 AIDC 交换机产品 —— CX-N 系列。
星融元(Asterfusion)CX-N系列数据中心交换机面向智算中心和云计算数据中心提供一站式全开放网络解决方案,具备低时延、高性能、高密度等特性。其依托业界领先的超低时延交换芯片,采用先进的硬件架构设计,提供高密度25GE~800GE端口,充分满足用户多样化的端口接入需求。
运行在CX-N交换机之上的 AsterNOS,是星融元为智算中心和云计算数据中心设计开发的开放网络操作系统。
本产品全系列标配RoCE特性,并基于用户生产网络进行优化,提供了EasyRoCE、智能负载均衡、PFC/ECN等无损网络特性,并集成了VXLAN、EVPN等丰富的数据中心特性。
产品型号: 星融元(Asterfusion)CX864E-N (64 x 800G OSFP)
功能特性:RoCEv2, PFC, ECN, DCBX ……
应用场景:GPU算力集群,分布式存储
最后更新:2026-05-18





































































