跳转到主要内容
数据中心

减缓人工智能推广速度的 4 个基础设施错误--以及如何避免这些错误。

c5a5880befd76eb5a78dcd8772b9522 Michael Wang 2026年4月27日
Data Centres AI

大多数对表现不佳的人工智能部署的事后分析都集中在模型选择、数据质量或工具选择上。基础设施很少成为标题。它应该是。

物理网络层--布线、连接、路径设计、光纤架构--现在已成为 GPU 群集性能的直接决定因素。光纤连接的密度、物理连接的质量:这些都不是背景条件。它们是性能变量。而在数据中心设计的早期,往往是在对人工智能工作负载需求进行全面评估之前做出的决定,可能会以昂贵和破坏性的方式限制性能。

以下是在人工智能部署中经常出现的四个基础设施错误,以及避免这些错误需要注意的事项。

  1. 设计带宽时不考虑损耗

传统的 IT 网络设计以吞吐量为中心:网络结构每秒能传输多少数据。对于人工智能训练和推理工作负载而言,这种设计框架忽略了关键变量。

在分布式人工智能训练中,GPU 与 GPU 之间的通信依赖于集体操作(AllReduce、AllGather、Broadcast),这些操作需要数十或数百个加速器同时紧密同步。底层传输通常是 RDMA over Converged Ethernet(RoCEv2)或 InfiniBand,对丢包和延迟变化非常敏感。即使是低于 0.1% 的丢包率也会触发重传事件,导致 GPU 同步停滞,造成整个集群的空闲时间累积。在一个 512 个 GPU 的训练集群中,单个拥堵的链路就会降低集群的总利用率,导致训练期在经济上不可行。

为人工智能设计意味着从一开始就指定一个无损、低延迟的结构:高质量的光连接可消除插入损耗变化,光纤基础设施可消除信号衰减的物理原因。带宽容量是必要的,但还不够。

  1. 锁定单代布线

人工智能基础设施的更新周期正在压缩。两年前在传统直流部署中为 100G 而建的部署已经面临 400G GPU 互联的压力。如今,指定 400G 的部署需要可靠的 800G 路径,而 1.6T 已经在路线图上。

错误的做法是针对当前的速度层优化物理层,而不留有余地。这通常表现为布线选择无法支持更高的调制格式,连接器配置无法接受下一代收发器的外形尺寸,或通道填充率无法在端口密度增加时为额外的电缆留出空间。

人工智能基础设施还要求采用不同的网络架构,如网状结构和脊状/叶状结构。面向未来的布线设计要考虑到技术的发展方向,而不仅仅是现在的位置。对于光纤而言,这意味着指定 OM4 或 OM5 多模(或单模),其密度可满足下一代收发器的需要,而无需全部重新铺设。对于光纤配线架,模块化设计允许未来因收发器外形尺寸的改变而扩展,也允许因新一代 AI-POD 而提高密度。布线的寿命以几十年为单位,而上面的有源电子设备则不然。将它们视为具有相同的更新周期是数据中心基础设施规划中最常见、成本最高的错误之一。

  1. 低估光纤数量需求

没有什么能比光纤数量更快地揭示传统 IT 网络设计与人工智能结构设计之间的差异。传统的数据中心规划模型是围绕服务器到 ToR 连接和南北向流量模式建立的,大大低估了 GPU 集群的光纤需求。

人工智能结构以东西向为主。每个 GPU 都需要一条高带宽、低延迟的路径,直接或通过脊柱与其他 GPU 连接。高密度骨干交换机是任何大型人工智能结构的骨干,每台设备可提供 64 个或更多 400G 端口。将 GPU 服务器完全连接到无阻塞 Fabric 的单个 pod 可能需要数千个单独的光纤连接,这也称为 Scale-up 网络。在人工智能的影响下,连接多机箱部署的扩展光纤架构也成为最重要的物理变化之一。

在进行人工智能培训之前,为这一变化部署的光纤密度可能会导致需要安装的光纤数量增加数倍。

高密度预端接 MPO 布线系统设计用于按照人工智能织物所需的光纤数量进行快速、无差错的部署,是解决这一问题的切实可行的办法,既适用于初始部署,也适用于随后的分阶段扩展。

  1. 将线缆管理视为事后考虑

在 GPU 密集的环境中,线缆管理不是一个内务问题。它是一个可靠性问题。

线缆管理决定了基础设施在整个运行寿命期间的可维护性。在 400G 环境中,拥挤的电缆盘意味着任何变化--收发器交换、端口重新分配、结构扩展--都有可能干扰相邻的连接。在物理连接器质量直接影响性能的环境中,这种风险并不小。弯曲半径小于最小弯曲半径的光纤、连接器接口处受力的光纤,或者在没有适当应力消除的情况下反复处理的光纤,都会随着时间的推移而降低信号完整性。

路由、标签和路径容量需要从第一天起就成为基础设施设计流程的一部分,而不是在选项有限的调试期间解决。

根据人工智能的实际需求建设基础设施

所有四个错误的共同点是时间线:在了解人工智能工作负载的全部需求之前就做出决定,并针对不会持续存在的条件进行优化。补救措施是在设计物理层时,采用与计算和软件架构相同的前瞻性规范--指定使用寿命、密度和净空,而不是当前的最低可行配置。

Aginode 的数据中心连接产品组合--包括高密度光纤布线、预端接 MPO 解决方案和支持高达 400G 或更高速度的双工 LC 连接--正是为这些环境而设计的。

Aginode 数据中心解决方案
更多信息

Share this

About the author

c5a5880befd76eb5a78dcd8772b9522

王君原

Michael Wang (王君原) 是安捷诺亚太及中东和非洲地区产品总监。全国信息技术标准化技术委员信息技术设备互连分技术委员会SAC/TC28/SC25 委员,ISO/IEC SC25 WG3专家,曾参与综合布线系统多个国内及国际标准的制定和修订工作,参与编写多本行业白皮书,专注于智能楼宇布线、数据中心布线设计及规划,具有丰富的项经验;