扁平化网络支撑超算:亚马逊AI数据中心架构解密

当全球云服务商竞相部署万卡级AI训练集群时,网络已从“外围组件”跃升为算力核心。亚马逊网络服务架构师、数据中心网络之父James Hamilton在最新分享中,首次系统拆解支撑AWS超大规模AI训练的底层架构——扁平化网络设计。这一实践虽未披露具体模型或评测数据,但对于每一位参与AI基建的工程师而言,其工程哲学远比数字更具启示。

传统多层网络的性能瓶颈。在典型CLOS拓扑中,数据传输需经过多级交换机,每次跳转都引入额外延迟和抖动。对于需要频繁同步梯度的AI训练场景,这种时延直接摊薄GPU利用效率。更严重的是,随着集群规模从数百卡扩展至上万卡,传统网络的路由表规模和收敛时间呈指数增长,运维复杂度甚至超过算力提升带来的收益。

亚马逊的简化策略。James Hamilton描述的扁平化网络核心在于两处突破:其一,削减拓扑层级,通过定制化的交换机硬件和软件控制面,将经典三层(接入-汇聚-核心)压缩至两层甚至单层逻辑平铺;其二,路由策略精简,放弃部分柔性功能(如复杂QoS),专注低抖动、高吞吐的严格路径控制。这种“做减法”的思路并非降低通信能力,相反,它减少了协议开销,使得单机柜级别的带宽利用率提升至接近理论极限。

与业界方案的对比。谷歌数据中心长期采用定制化Jupiter网络,Meta也构建了基于Open Rack的扁平架构。不同的是,亚马逊将扁平化理念深度耦合于其长期积累的运营商级路由算法(如SRv6优化版本),并依托自研Nitro芯片实现了控制面与数据面的解耦。这使得AWS能在不依赖昂贵专用硬件的条件下,以软件定义的方式快速适配不同AI加速器(如Trainium、Inferentia)的通信形态。对于其他云厂商或大型企业,这套方法论意味着网络升级不再是“换设备”的过程,而是“改策略”的持续迭代

对基建从业者的实用建议。面对当前AI训练的高速演进,基础设施团队应率先审视自身网络的三项指标:东西向带宽利用率、尾延迟(P99)抖动、以及路由收敛时间。James Hamilton的分享提示我们:不必盲目追求高端硬件,而应通过拓扑简化与路由策略的极致调优,释放现有光互联与交换机潜力的80%以上。具体行动上,可尝试将冗余的第三层收敛层合并,转向基于全连接或部分Mesh的扁平架构;同时引入基于意图的自动路由编排,减少人工干预导致的收敛偏差。

趋势展望:随着万卡、十万卡集群成为现实,传统以太网与InfiniBand的边界正被打破。亚马逊的实践验证了“简化即高性能”在超大规模场景下的有效性,未来网络架构或将走向更极致的扁平——借助光电混合传输与在网计算,让数据包在物理层就完成协同。对于所有试图构建下一代AI基础设施的团队,此刻正是重新审视网络架构设计哲学的黄金窗口。