在 AI 数据中心环境中驾驭超高密度 400G 与 800G 网络
人工智能(AI)正在迅速改变数据中心的格局。从训练像 ChatGPT 这样的大型语言模型(LLMs),到提供个性化内容和预测性分析,超大规模用户、云服务商和大型企业正在构建高性能计算(HPC)网络,利用加速并行处理技术来释放 AI 的潜力。让我们来看看这些 AI 网络是如何部署的,以及它们所带来的线缆测试挑战。

人工智能网络的两面:后端与前端
数据中心的 AI 依赖于两种不同的网络架构:后端 用于密集型训练,前端 用于实时推理。在训练过程中,AI 模型通过分析 AI 集群或 GPU 架构中互联的高性能图形处理单元(GPU)间的海量数据集,学习识别模式、做出预测并得出结论。这一计算密集型过程需要 GPU 之间进行高带宽、低延迟的数据传输,以实现高效的模型训练和更快的洞察生成。
AI 模型训练完成后,推理 阶段便是将其投入实际应用——响应用户查询,并根据新信息得出结论。这一过程的计算密集度远低于训练阶段。以犬种识别应用为例:训练 是 AI 模型通过分析数万张带标签的图片来学习识别不同犬种的过程;而 推理 则是模型识别你发送给它的一张新的狗狗图片时的过程。
AI 集群内的计算密集型训练发生在后端数据中心网络中,这是一个专为加速 GPU 数据传输和处理而设计的专用、封闭环境。相比之下,前端网络 将 AI 系统连接到外部世界以进行推理,处理用户请求以及其他通用数据中心工作负载(如网页托管、电子邮件和存储)。这两种网络协同工作,共同管理数据传输、存储和用户交互。
前端和后端网络架构有一些区别:
- 前端网络采用传统的三层或叶脊型以太网架构,包含用于服务提供商分界、交换机层级、存储设备和基于CPU的基础服务器的多个功能区域。此处的交换机到交换机连接通常使用单模或多模光纤,搭配多纤芯MPO连接,速率从100G到400G不等;而交换机到服务器链路则倾向于采用25G到100G的双工多模光纤连接。
- 后端网络几乎完全采用叶脊型架构,其中叶交换机(有时称为导轨交换机) 在集群内提供高带宽、低延迟的 GPU 互联,脊交换机 则负责多个集群之间的连接。目前,后端网络中的交换机到交换机连接主要以 800G 为主,使用 16 芯 MPO 连接器(8 根光纤发送、8 根光纤接收,每通道 100 Gb/s)。部分超大规模用户和大型云服务商已开始在后端网络中向 1.6T 交换机连接 过渡,采用 两个 16 芯 MPO 连接器 实现。
后端网络中的 GPU 通常以 400G 速率连接,使用 8 芯 MPO 连接器(4 发 4 收,每通道 100 Gb/s),部分 GPU 连接正向 800G 演进。与以前端网络为主的以太网不同,后端网络中的 GPU 互联常采用 InfiniBand 协议,并结合 远程直接内存访问(RDMA) 技术以降低延迟。基于融合以太网的 RDMA(RoCE) 是一种新兴替代方案,兼具两种协议的优势。
为了进一步降低延迟,GPU 通常直接连接至其叶交换机,从而省去了用于管理设备连接的结构化布线(包括互连和交叉连接)。这些直接连接采用预端接 MPO 光纤组件或直连双轴铜缆/光缆组件。单个 AI 集群可包含数百个 GPU,其功耗高达 CPU 的 10 倍,导致发热量大幅增加,要求数据中心为这类集群环境投资更先进的冷却技术,如液冷。

计算密集型AI训练在封闭的专用后端网络中进行,而前端网络则连接AI系统与外部世界,并与后端网络协同工作,管理数据传输、存储和用户交互。
数据中心AI基础设施测试的挑战
在后端AI集群中以400GB或更高速度连接数百个GPU,导致数据中心的光纤密度极高,这在测试和排查时带来了一些独特的挑战。
- ****检测光纤端面是否有污染至关重要,以防止信号丢失和反射导致性能下降,但在超高密度环境中检查端口可能较为困难。Fluke Networks FI-3000 FiberInspector™ Ultra Camera 提供 PortBright™ 照明解决方案,确保在密集环境中更清晰可见,并配备自动对焦/自动居中功能,实现光纤端面即时实时查看,包括轻松变焦,可检查单个光纤端面或整个 MPO 阵列。FI-3000 FiberInspector Ultra Camera 标配 12 和 24 光纤 UPC/APC MPO 端面检测的尖端,并可选配 MMC 和 12 至 32 根光纤的无键 MPO APC 尖端。
如果检查发现需要清洁MPO或MMC接口,Fluke Networks提供快速清洁™清洁器,有效去除隔板MPO/MTP和MMC连接器端面的污染物,以及各种双工连接器。

Fluke Networks FI-3000 FiberInspector™ Ultra 摄像头以及快速清洁™ MPO/MTP 和 MMC 清洁器非常适合在高密度数据中心环境中(如 AI 集群)检测和清洁光纤端面。
- 后端网络中 400G 以太网或 InfiniBand 高速光纤链路的插入损耗测试,应使用内置 MPO 接口的测试仪,如Fluke Networks的MultiFiber™ Pro MPO测试仪,该测试仪可同时扫描所有光纤并显示整条链路的损耗结果。MultiFiber Pro测试器还会检测MPO链路的极性正确,这对于确保每根传输光纤对应其接收光纤至关重要。目前,800G 链路 中使用的 16 芯 MPO 测试需要一根 Y 型分支光缆(16 芯 MPO 连接器转两个 8 芯 MTP/MPO),分别测试每个 8 芯支路,再将结果合并以确定整体链路损耗。
- 超小型(VSFF)光纤连接器——如MDC和SN-MT双工连接器以及MMC阵列连接器,这些连接器的密度是传统连接器的数倍——在高密度AI集群中变得越来越常见。Fluke Networks 目前提供行业推荐的 MDC 连接器单跳线参考,并将在其他 VSFF 连接器类型被广泛采用后开发类似方法。在此之前,测试可以用三跳线参考法进行。Fluke技术支持中心(TAC)可以提供测试新VSFF连接器的指导。

Fluke Networks 的 FiberLert™ 在线光纤检测器检测到 QSFP 收发端口的有源光纤信号。
当AI网络出现问题时,通常需要排查QSFP收发器。您可以使用Fluke Networks的FiberLert™在线光纤检测器,通过多模或单模收发器端口快速安全地确认光纤活动和连接。其小巧体积便于接入高密度交换端口。当你需要更深入的排查时,Fluke Networks 的 OptiFiber™ Pro OTDR 可以定位并测量特定事件(连接器、断裂、弯曲等)的信号衰减和反射率。
AI在数据中心的整合将继续推动网络布线架构的重大演进,而随之而来的更高密度将给数据中心运营商带来持续的挑战。随着行业不断突破AI能力的边界,强大高效的测试和故障排除解决方案对于确保这些400 Gig+网络的可靠性和性能至关重要。