亚马逊如何用扁平网络打破AI算力瓶颈?揭秘支撑万亿参数训练的幕后工程

当DeepSeek等大模型参数规模突破万亿,训练集群的通信效率正成为比算力更棘手的瓶颈。亚马逊网络服务副总裁、传奇架构师James Hamilton近日在一篇技术长文中,首次系统拆解了其数据中心网络架构的底层逻辑:通过极致的扁平化设计,为AWS上的大规模AI训练铺设“无阻塞”的通信管道。

扁平化的本质是“做减法”。传统数据中心网络多采用三层Clos架构,虽能提供冗余路径,却带来复杂的路由表和拥塞控制难题。亚马逊的实践表明,在AI训练这种同步+并行计算的场景下,任何非对称拓扑或拥堵跳点都会导致通信延迟急剧放大,直接影响模型训练的收敛速度。

简化拓扑结构是其核心举措:通过减少交换机层级、采用统一的全连接拓扑,并将路由策略收敛至BGP单一协议。这不仅消除了路径不对称带来的负载不均,还大幅降低了网络状态维护带来的CPU开销——在动辄数千节点的集群中,这种“瘦身”直接转化为毫秒级的延迟降低。

这背后是亚马逊对“开放网络”理念的呼应。与专有硬件绑定方案不同,亚马逊坚持使用标准交换机与开源软件,这使其能够以较低成本构建并迭代超大规模网络。在AI算力成本高企的当下,这种将网络基础设施“白盒化”的思路,为其他企业提供了可复用的路径。

值得注意的并非具体模型数据——James Hamilton通篇未披露任何性能评测,这不是一篇炫耀“最好”的广告,而是一份关于“如何做对”的工程笔记。它表明:即使不依赖昂贵的专有硬件,通过软件层面巧妙地做减法、减少瓶颈跳点,同样可以支撑起万亿参数级别模型的高效训练。

对于企业级AI基建团队,这份实践至少有两点启示:一是在规划网络架构时,应优先考虑与训练任务特征匹配的拓扑简化,而非盲目追求全连通或高冗余;二是面对AI带来的算力越贵、通信越重、瓶颈越宽的挑战,从网络层面“降维”或许比单纯堆GPU更聪明。Amazon的扁平化网络正在证明,没有复杂架构,只有不匹配的设计。