在大模型训练对算力和通信带宽提出极限要求的当下,亚马逊AWS首席工程师James Hamilton亲自披露了支撑其超大规模AI集群的底层数据中心网络设计——扁平化架构。这一源自工程实践的技术方案,揭示了传统多层网络拓扑在面对数万张GPU并行计算时的核心瓶颈,以及亚马逊如何通过简化拓扑和路由策略突破性能天花板。
根据亚马逊分享的细节,其数据中心网络采用了spine-leaf(脊叶)扁平拓扑取代传统的三层(接入-汇聚-核心)架构。这一改变的关键在于:所有服务器节点通过同一层级的叶交换机直连脊交换机,避免了多层跳转带来的延迟累积。对于大规模AI训练(如千卡级分布式学习),每个通信步长都可能涉及AllReduce等全局集体操作,毫秒级延迟差异会显著影响训练效率。扁平化网络将东西向流量(服务器之间)的跳数从6-8跳压缩至2-4跳,从而将核心网延迟降低一个数量级。
在路由策略上,亚马逊并未采用通用的ECMP(等价多路径)或OSPF等传统协议,而是设计了定制化的无状态路由机制。由于AI训练流的特点是“大象流”(持续高吞吐)混同大量短事务流,传统哈希算法容易导致哈希冲突和链路饥饿。亚马逊的解决方案是:在脊交换机层引入基于流标签的快速转发,同时利用端侧的拥塞感知反馈环路,动态调整流量分布。James Hamilton指出,“网络应该像交换机内部的Crossbar一样透明”,这一理念推动了其路由层级从三层压缩到两层,并完全去除了核心路由表。
对比行业实践,谷歌的Jupiter网络同样采用Clos拓扑,但亚马逊的工程重心在于运维简化。他们通过硬件支持的协议卸载和自动化配置,使网络运维人员可独立管理每个pod(网络单元),将故障影响范围限制在单一pod内。这对超大规模集群尤为重要——在数万节点规模下,故障成为常态而非例外。亚马逊还强调网络设备上的“主动健康检测”机制,能够在亚秒级感知链路降级并触发重路由,避免训练任务的长时间停顿。
对基础设施从业者而言,这一披露意味着:面向AI的训练网络正从“通用型”走向“任务专用型”。传统数据中心网络追求灵活兼容,但在极端规模下必须为特定通信模式做优化。建议同行在自建AI集群时,优先考虑裁剪BGP协议栈、引入端网协同的拥塞控制(如RoCEv2配合DCQCN),并提前规划好Pod的隔离粒度。亚马逊的实践表明:网络设计的“减法”往往比“加法”更能释放硬件潜力,过度复杂的分层结构反而会成为训练效率的瓶颈。随着AI模型参数持续增长,更扁平、更智能的数据中心网络架构将成为标配。