大模型推理中,KV(Key-Value)Cache的显存占用一直是制约长上下文场景落地的关键瓶颈。随着上下文窗口动辄扩展到128K甚至更长,缓存开销呈线性增长,如何在压缩缓存占用与保持模型能力之间找到最优平衡,成为业界普遍关注的问题。
现有的主流压缩策略,如SnapKV、KeyDiff,通常采用启发式或基于局部重要性评分的方法来为各注意力头的缓存分配预算。这类方案虽然在特定场景下取得不错效果,但其本质是“看当前”,即根据一次性的、孤立的分数进行分配,忽略了不同注意力头在整个长序列推理过程中的边际效用差异。这样的局部最优选择,往往会错过全局更优的分配方案。
百度百舸团队与复旦大学合作提出的Long-horizon Utility KV(LU-KV)框架,正是针对这一局限给出了系统性的解决方案。LU-KV的核心创新在于:它将头级KV Cache预算分配明确建模为面向长程边际效用的全局组合优化问题。具体而言,该方法通过离线画像技术,为每个注意力头估计出一个边际贡献曲线——即随着分配缓存的增加,该头对模型最终输出的增量价值。随后,引入凸包松弛结合基于边际效用的贪心求解器,在极低的计算开销下,逼近理论上接近最优的缓存预算配置。
换句话说,LU-KV不再简单地将每个头的缓存预算视为独立变量,而是从全局视角出发,将“应该给哪些头部更多缓存”的问题,转化为一个可求解的组合优化问题。这一转变,使得最终得到的分配方案在80%压缩比下依然保持极低的性能损失,同时显著降低显存占用和推理延迟。
值得关注的是,LU-KV并非一套孤立的方法。论文明确指出,该框架可以适配SnapKV、KeyDiff等多类已有的压缩技巧,具备较强的通用性。在LongBench和RULER等长文本基准上的测试结果进一步验证了其有效性:在高压缩率下,LU-KV配置的模型与未压缩版本相比,在复杂推理任务上的差距被大幅缩小。
从行业角度看,LU-KV为KV Cache压缩提供了一个崭新的理论支撑点。以往业界多聚焦于“如何压缩”,而LU-KV则回答了“压缩谁”这一更上层的问题。这其实是从算法创新转向系统创新的一个重要信号。被ICML 2026录用,也从侧面表明学术界对这一思路的认可。
对于工程实践者而言,LU-KV提供了可落地的技术路径。建议关注其开源实现,尤其是其中离线画像与贪心求解器的实现细节。对于需要频繁进行长上下文推理的团队(如长文档分析、代码生成、多轮对话系统),适时引入全局优化的缓存分配策略,有望在不显著增加工程复杂度的情况下,切实降低部署成本。
展望未来,KV Cache的优化将不再局限于某一压缩算法本身的精度提升,而是会在计算-存储联合优化的方向上持续演进。LU-KV的出现,是一个值得重视的里程碑。