扎克伯格确认千兆瓦级AI集群计划,算力军备竞赛进入“千亿美元”时代

当Meta CEO马克·扎克伯格亲口说出“我们正在建设这个Prometheus集群,首个千兆瓦以上的单一集群……我们是在谈论数千亿美元的资本投入”时,AI行业的算力叙事被重新定义。这不只是一项巨额投资公告,更是一份关于未来AI竞争形态的宣言:千兆瓦级算力集群,正从科幻概念变为工程现实。

千兆瓦(GW)是什么概念?目前全球已公开的最大单一AI集群,如微软为OpenAI建设的超算集群、谷歌的TPU Pod,功率级别多在百兆瓦级。千兆瓦意味着算力容量提升一个数量级,其能耗相当于一座中型城市的用电规模。扎克伯格提到的“Prometheus”集群,仅电力基础设施就需要数百亿美元的配套投入,更不用说GPU、网络、冷却、运维等成本叠加后的数千亿美元总账。这一数字远超此前Meta单年度资本开支预期(约350-400亿美元),足以让任何一个竞争对手感到压力。

对比来看,微软对OpenAI的总投资已累计超过130亿美元,谷歌的TPU布局每年约200亿美元资本开支,而Meta作为后来者,直接选择“跳跃式”投入。这背后是扎克伯格对AGI(通用人工智能)目标的激进押注:他此前表示Meta计划在2023年年底前拥有等效于60万张H100的算力,而Prometheus集群的落成将使这一数字成倍增长。值得注意的是,Meta并非只做模型,其同时拥有Llama开源生态、社交平台应用的支撑,算力军备从“军火商”延伸至“战地指挥官”的双重角色。

对于依赖云算力的团队和创业者,这一信号不容忽视。千兆瓦级集群并非“规模更大”,而是改变了算力的供给逻辑:当头部玩家以数千亿美元自建专属集群时,市场上的公有云GPU供应可能会被进一步挤压,尤其是高端H100/H200及之后的B100算力。同时,这类超大规模集群往往服务于特定模型或业务线(如Meta的Llama 4、广告推荐系统),导致通用算力资源稀缺性上升,云服务价格上涨风险加剧。反之,对于那些自建算力能力有限、依赖API调用的中小团队,未来或将面临更长的排队时间和更高的边际成本。

从产业趋势看,千兆瓦级集群的出现将加速算力“电力化”进程——数据中心不再仅是IT设施,而是类似水电站的能源密集型工程。这迫使AI从业者重新思考技术路线:是继续追逐更大参数量的稠密模型,还是转向稀疏化、量化、MoE等更高效的架构?对于创业者,一个务实的建议是:在算力资源有限时,优先选择可压缩、可分布式部署的小模型方案,同时保持对头部厂商算力锁定的警惕。

扎克伯格的“数千亿美元”宣言,不仅是一张支票,更是一把尺子——量出了AI产业从“算力竞赛”到“算力霸权”的跨度。未来五年,谁能驾驭瓦特与浮点运算的双重杠杆,谁就能在智能时代的牌桌上占据最有利的位置。