扎克伯格亲口证实,Meta正在推进一个名为“Prometheus”的千兆瓦(GW)级单一AI集群——单个数据中心功率超过1GW,资本开支规模数千亿美元。这一消息来自他在公开场合的发言,由@rohanpaul_ai在社交媒体上转载后引发行业震动。千兆瓦是什么概念?它相当于一座中型核电站的额定输出功率,足以支撑超过50万台H100 GPU同时满负载运行。相比之下,此前微软为OpenAI建设的百兆瓦级集群已被视为工程奇迹,而Meta此番直接跳到GW级,意味着AI基础设施的“军备竞赛”正式进入核动力阶段。
扎克伯格并未透露Prometheus的具体部署时间表,但从Meta的资本支出计划推算,2024年其基础设施投入已超300亿美元,而千兆瓦级集群的建设成本通常在1000亿至2000亿美元之间,需分多年摊销。值得注意的是,Meta同时投资自研芯片(MTIA)和开放大模型Llama系列——看似矛盾:一方面通过开源降低模型壁垒,另一方面却以天价算力锁死竞争门槛。这种策略的深层逻辑在于:基础设施规模本身就是最硬的护城河。当算力密度达到GW级,模型训练效率、推理延迟和成本曲线将产生质变,中小玩家的训练成本可能翻倍甚至更多。
行业背景更耐人寻味:全球前三大云厂商(AWS、Azure、GCP)的AI相关资本支出在2024年Q3累计超过500亿美元,同比增长260%,但单个集群功率仍停留在200-400MW区间。Meta的GW级计划直接挑战了当前的数据中心供电、散热和网络架构极限——液冷方案必须从单相浸没升级为两相或热管辅助,Rupert神经网络互联(如InfiniBand 800G)需重新路由。这不仅是投入金钱,更是对工程能力的极限测试。
对于依赖云算力的AI创业团队,这意味着两个趋势:第一,短期内头部云厂商会优先将算力供给自研或核心合作伙伴,独立GPU租赁价格可能被进一步抬高;第二,长期看,巨型集群将推动模型训练成本曲线加速下降——但前提是你能接触到那个级别的算力。建议小团队更聚焦于“模型优化”(蒸馏、量化、稀疏化)和“边缘推理”(手机、IoT芯片),避开与巨头在训练规模上的正面竞争。同时,关注联邦学习、分布式训练等降低单点算力依赖的技术路径。
算力军备竞赛的下一站,或许是多个GW级集群异构互联——就像当年CPU从单核走向多核。扎克伯格的发言已经揭开了序幕:千亿美元不是终点,而是新纪元的起跑线。