在大模型军备竞赛中,GPU算力长期被视为唯一的稀缺资源。然而,当集群规模突破百万级GPU时,存储I/O延时往往成为隐形瓶颈——一次元数据查询可能耗费数百毫秒,迫使整批GPU任务等待单个慢速的存储节点。Meta近日发表的工程博客揭示了其如何通过重构BLOB存储架构,在数百EB级集群中化解这一矛盾,为行业提供了一条可复用的实践路径。
传统BLOB架构的元数据陷阱。多数AI训练框架依赖分布式文件系统或对象存储,但这类系统为管理海量小文件和元数据,通常设计多层索引树。每一次数据读取都需要遍历目录树、检查权限、定位块位置,延迟波动极大。Meta实测显示,在重度并发场景下,尾延迟(pMax)可达到数十毫秒甚至数百毫秒,而训练数据的预取与缓存策略往往无法覆盖这种随机性。当数百个GPU同时等待同一批数据时,单个慢速IO就能拖慢整个数据并行训练作业的吞吐。
闪存直连与可预测低延迟。Meta的解决思路并不复杂:将训练数据栈逐步迁移至BLOB存储接口之上,并利用闪存(NVMe SSD)构建专门的低延迟缓存层。关键在于,他们重写了元数据查询逻辑,不再依赖传统树形索引,而是采用分层缓存与预测性预取机制——GPU在开始计算前,存储系统已根据任务计划将热数据推送至本地或临近闪存节点。这样,每次IO的pMax延迟被严格控制在亚毫秒级,消除了因I/O抖动导致的GPU空闲。这种设计借鉴了超大规模数据中心中的“分形缓存”理念,但首次在AI训练场景中实现工程落地。
跨区数据移动加速研究迭代。除了提升单次训练的效率,Meta还强调统一数据湖层的作用。传统方案中,地理分布的多数据中心间数据复制依赖批量同步,延迟高达数分钟。而Meta通过将Tectonic存储系统与BLOB接口深度融合,使得数据可从数据湖中的高速缓存点对点注入GPU集群,并支持跨地域的移动。研究人员无需等待数据预同步即可启动新实验,迭代周期从周级压缩至小时级。这直接提升了模型架构调优和超参数搜索的速度。
行业启示。当前,多数AI平台仍在使用通用分布式文件系统(如Lustre、GPFS)或对象存储(如S3)直接对接训练框架。但Meta的案例表明,当集群规模超越百EB时,通用系统的元数据瓶颈将成为不可忽视的负收益。未来的AI基础设施设计应优先考虑:将存储的元数据层与数据层解耦,基于闪存构建可预测低延迟路径;训练框架需适配对象存储接口,减少POSIX语义带来的抽象损耗。对于正在建设万卡级集群的企业,借鉴Tectonic的分层缓存思想,或许比单纯堆砌GPU更为关键。