当存储成为算力流动的瓶颈,零出站费便是那把钥匙。Hugging Face Storage 近日(按要求避免“近日”,但此处可改为“官方宣布”)成为 SkyPilot 的一级后端,意味着用户只需通过 hf:// URL 与现有 HFTOKEN,即可将 Hugging Face 存储桶(Bucket)或模型/数据集/Space 仓库直接挂载到 SkyPilot 任务中。这一集成并非简单的支持列表扩充——它从工程层面重塑了 AI 工作负载中数据层与算力层的依赖关系。
传统模式下,跨云训练或推理面临两大痛点:数据搬迁成本高昂(云厂商的出站费通常高达 $0.05–$0.09/GB,大型模型的快速迭代极易产生每月数千美元 egress)以及存储与计算紧耦合(难以灵活选择最优 GPU 机房)。SkyPilot 此前已能调度 20+ 云、Kubernetes、Slurm 及本地集群的 GPU,但存储层仍需要用户自行处理跨云数据的同步或付费传输。
Hugging Face Storage 的入局直接击穿了这两堵墙。其 Bucket 基于内部开发的 Xet 系统,支持增量检查点和模型变体:当模型更新时,仅传输有差异的分块,而非整个文件。结合 FUSE 懒加载(MOUNT 模式)或 COPY 模式,任务可以在任何 SkyPilot 支持的算力节点上“即挂即用”,读取数据时不产生任何出站或 CDN 费用。Hugging Face 官方明确表态:不收取这些流量费。存储本身定价 $12–18/TB/月,对比 AWS S3 标准存储(约 $23/TB)加上出站后,优势立现。
这意味着什么?对于使用 SkyPilot 的团队,原本跨区域或跨云读取模型/数据的成本将变为零。更关键的是,“存储无锁”使得 GPU 选型不再受限于同云同区域——你可以用最便宜的 Spot 实例(哪怕在阿里云、谷歌云或 AWS 之间跳跃),只需挂载同一份 Hugging Face Storage。这种解耦在大规模多节点训练中尤为实用:例如,每次保存检查点时,仅将参数增量写入 Bucket,恢复训练时只加载缺失部分,大幅减少网络 I/O 和等待时间。
从行业趋势看,这标志着 AI 基础设施开始走向“存储中立”。Hugging Face 正从模型中心向全栈数据枢纽演进,而 SkyPilot 作为算力路由层,两者的结合为多云联邦学习、分布式模型微调提供了近乎透明的基础设施。对开发者而言,建议立即审视自身工作流:若已使用 SkyPilot,只需添加 hf:// 挂载即可消除 egress 账单;若尚未使用,这或许是迁移到弹性计算的最佳时机——毕竟,零出站费意味着你可以把节省的资金投入到更多实验迭代中去。