扎克伯格官宣千兆瓦级AI集群:算力军备竞赛进入万亿美元时代

当全球还在消化英伟达H100与B200的功耗戏剧时,Meta的扎克伯格直接将AI基础设施竞赛推向了全新量级。他首次公开确认,Meta正在建设名为“Prometheus”的单一AI集群,其功率目标超过1千兆瓦——这相当于一座小型核电站的电力输出,或者100万块H100 GPU同时满载运行。更关键的是,他坦承:“我们谈论的是数千亿美元的资本投入。”

这一表态将AI算力军备竞赛的坐标轴从“数据中心数量”彻底转向“集群级别”。此前,业界普遍认为万卡集群(10,000+ GPU)已是极限,而千兆瓦级集群意味着单集群可容纳数十万甚至上百万张加速卡。相比之下,微软、谷歌目前公开的最大集群规模仍在百兆瓦级别。Meta的野心在于通过单一超级集群实现训练与推理的极致一体化——减少跨数据中心通信延迟,直接提升模型训练效率与实时推理吞吐量。

但对于云算力生态而言,这则消息释放的信号极其复杂。一方面,Meta、微软、谷歌等巨头自建千兆瓦集群,意味着它们将彻底摆脱对外部云服务的依赖,转而以内部算力池驱动下一代AI研发。另一方面,高昂的电力与土地成本(千兆瓦集群需要配套自建变电站、冷却系统乃至小水电或核电协议)将推高整体AI基础设施的成本基准线。那些依赖AWS、Azure等公共云租用算力的创业团队,将面临两个残酷后果:一是优质算力(如H100/B200)被巨头优先囤积,租用价格上涨;二是云服务商为满足大客户需求,可能压缩中小客户的可用资源配额。

值得注意的还有时间窗口。扎克伯格并未给出集群建成时间表,但按当前硬件交付周期与现场建设进度,Prometheus集群很可能在2026年前后进入初步投产。届时,以Meta Llama系列为代表的开源模型将获得完全不输闭源模型的训练基础——这或从根本上打破OpenAI与谷歌的“算力护城河”。同时,千兆瓦集群的运维经验(尤其是电网稳定性、散热与容错)将反哺整个行业,催生新的电力-计算协同技术和更高效的冷却方案。

对从业者而言,三条建议值得收藏:第一,若你的团队仍以按需租用GPU为主,尽快与云服务商签订长期预留合同(至少1-2年),锁定价格与产能;第二,关注芯片能效比而非单纯峰值算力,千兆瓦级集群对能效的敏感度将传导至整个供应链;第三,战略上必须评估是否加入“自建算力”行列——当巨头将单集群做到千兆瓦,小型集群的边际单位成本可能不降反升。算力军备竞赛的终局,不是比谁卡多,而是比谁能在每一瓦特里压榨出更多智能。