当大型语言模型的部署成本成为企业落地AI的核心掣肘时,NVIDIA再次献上了一份来自系统优化侧的硬核解法。Nemotron-Labs-3-Puzzle-75B-A9B——这个名称冗长但信息量密集的模型,本质是Nemotron-3-Super的压缩变体,却实现了远不止参数缩小的效果:总参数量从120.7B降至75.3B,活跃参数从12.8B降至9.3B,同时维持88块混合布局(40块Mamba、40块MoE、8块注意力)。在8×B200节点上,当用户吞吐量锁定在≥100 tok/s时,服务器吞吐提升至原来的2.03倍;单张H100 GPU上,处理1M-token连并发请求从1个飙升至8个,权重占用从70 GB锐减至44.5 GB。
这一轮压缩采用的“迭代式Puzzle方法”尤为关键——它并非一次裁剪,而是通过多轮微调与知识蒸馏,将平均得分比单步压缩提高了0.57。代价也清晰呈现:Arena-Hard-V2下降4.2分,SWE-Bench下降2.6分。对于纯对话或代码生成场景,这一精度损失或许需要业务侧重新评估;但对于长上下文RAG和AI编码助手这类对吞吐极度敏感、但对单次生成质量的边际差异容忍度较高的产品,2倍的服务器吞吐提升和8倍的并发扩展是近乎扫清推理瓶颈的利器。相比业界常见的MoE模型(如Mixtral 8x7B活跃参数约12.9B),Nemotron压缩版本将活跃参数进一步压至9.3B,配合Mamba与注意力混合架构,在同等算力下实现了更高的服务密度。
从工程角度看,Hugging Face上已提供BF16、FP8及NVFP4三种精度的检查点,意味着开发者可以直接对标自家的推理框架进行部署。对AI infra团队而言,这不是一篇理论论文,而是一个可以直接投入产线测试的降本方案。但需要注意的是,精度下降并非均匀:SWE-Bench损失2.6分可能影响复杂代码合成任务,建议在部署前对目标场景进行差异化评测。趋势上,NVIDIA通过这种“压缩-量化-混合架构”的组合拳,正将billion-scale模型的部署门槛拉低一个数量级。未来,模型不是越做越大,而是越压越巧——这或许正是大模型竞赛下半场的核心叙事。