千亿豪赌AI算力:扎克伯格确认千兆瓦级单一集群计划,算力军备竞赛进入新阶段

当全球还在为百兆瓦级超算的能耗与成本争论时,Meta创始人扎克伯格已悄然将赌注推向下一个数量级。在一次公开访谈中,他亲口确认正在建设“首个千兆瓦以上的单一AI集群”,并直言“我们是在谈论数千亿美元的资本投入”。这一表态将AI算力竞赛从“军备升级”直接推入“星球大战”模式。

千兆瓦是什么概念?一个千兆瓦(GW)的电力容量相当于一座中型核反应堆的满额输出,足以供应约75万户美国家庭的日常用电。此前业界最大的单体AI集群——如微软为OpenAI训练的百亿参数模型所用集群——功率约在200-300兆瓦级别。Meta直接跳过中间台阶,将单体功耗提升三到五倍,意味着其训练集群的GPU数量或达数十万张,远超目前任何公开部署。扎克伯格透露,该集群专为下一代大模型与通用人工智能(AGI)研发设计,旨在通过单一物理场所的极致互联密度,消除跨数据中心通信延迟,从而加速模型收敛。

资本投入的“数千亿美元”并非虚指。以当前H100 GPU单价3万美元、配套冷却、网络、电力设施成本倍数计算,一个千兆瓦级集群的硬件采购与基建费用轻松突破500亿美元。若加上长期运营电力、散热、人力及后续芯片迭代,十年总拥有成本(TCO)确实可能逼近万亿门槛。这一数字已超过许多国家年度GDP,显示顶级科技公司正将AI基础设施视为类似“国家战略工程”级别的单项投资。

算力军备竞赛的“集中化趋势”值得警惕。过去几年,主要云厂商多采用多集群分散部署,以降低单一地点风险并灵活利用闲置资源。但扎克伯格的决定暗示,当模型参数迈向万亿级,数据并行与模型并行的通信开销成为瓶颈,集中式集群的同步效率优势可能超过风险。这对依赖云算力的中小团队是双重打击:一方面,顶级GPU资源被“巨无霸”集群锁死,可租赁份额缩水;另一方面,集中化采购进一步推高硬件市场价格,创业公司的单位算力成本被迫上升。

这一动向也折射出AI行业的结构性分化。微软、谷歌、亚马逊与Meta之间的“四大支柱”格局已定,每家都在自研芯片与定制集群。扎克伯格的千兆瓦计划并非孤例——此前有报道称微软与OpenAI正在规划一个耗资1000亿美元的数据中心项目,谷歌也在加速部署Tensor Processing Unit(TPU)v5的百兆瓦级集群。不同的是,Meta选择以单一站点实现极致密度,这对其能源基础设施选址、电网容量和散热技术提出了前所未有的挑战。液冷方案(如浸没式冷却)或将从可选变为标配。

对行业参与者而言,需要重新评估自身的“算力路径”。创业者应放弃“买卡自己训练”的幻想,转向以下策略:一是与云厂商签订长期“算力期货”锁定资源;二是利用千兆瓦集群输出后可能释放的“上一代算力”进行微调与推理;三是主动拥抱模型压缩、混合专家系统等计算高效架构。对于投资者,此消息强化了AI基础设施赛道的长坡厚雪属性——相关电力设备、散热方案、光互联芯片企业将受益于资本开支浪潮。

结语:扎克伯格的千兆瓦宣言,本质是宣告AI竞赛进入“资本壁垒”阶段。当单一集群投资超过国家级太空计划,中小玩家的生存窗口正在收窄。算力,正从技术参数演变为地缘政治级的战略资产。唯一确定的是,这张牌桌上的赌注只会越来越大。