百度百舸复旦LU-KV:以全局边际效用重构KV缓存分配,获ICML 2026认可

大模型长上下文推理中,KV Cache的显存占用正成为瓶颈:上下文窗口扩展至百万tokens时,单次推理的KV缓存可能占据数十GB显存,直接制约部署效率和成本。现有压缩方法——如SnapKV、KeyDiff、H2O等——多采用基于注意力分数或频率的局部剪枝策略,逐层或逐头独立决定保留哪些键值对。这种“短视”分配忽略了不同注意力头之间的长期依赖和边际收益差异,导致全局缓存利用率偏低。

百度百舸团队与复旦大学联合提出的Long-horizon Utility KV(LU-KV)框架,将这一问题的解决方案推向理论化。该框架的核心思路是将头级KV缓存预算分配重新定义为面向长程边际效用的全局组合优化问题。不同于传统方法对每个注意力头单独计算重要性,LU-KV通过离线画像估计每个注意力头在整个序列上的边际贡献曲线,即增加单位缓存预算能带来的额外收益。在此基础上,框架引入凸包松弛技术对非凸的边际效用函数进行近似,再结合基于边际效用的贪心求解器,在极低额外开销下得到接近全局最优的预算配置。

这一设计的关键洞察在于:不同注意力头对长距离依赖的敏感度存在显著差异,统一压缩策略往往在重要头上过度剪枝,而在冗余头上浪费预算。LU-KV通过全局优化实现“好钢用在刀刃上”——将更多缓存预算分配给那些对长程上下文理解贡献更大的注意力头。实验表明,在LongBench和RULER基准上,即使达到80%的压缩比,LU-KV的性能损失也远小于同等压缩率下的现有方法,同时显著降低了显存占用和推理延迟。更重要的是,LU-KV可以无缝适配SnapKV、KeyDiff等多种压缩方法,作为上层的预算分配策略,提升这些方法的整体性能。

从行业角度看,LU-KV的诞生标志着KV Cache压缩正从经验主义走向优化理论驱动。此前,业界多依赖启发式规则(如保留最近tokens或高分数tokens),但缺乏对“极限压缩下哪部分信息更重要”的形式化回答。LU-KV以边际效用为工具,给出了一个可计算、可泛化的框架。被ICML 2026录用,也意味着这一方向获得了顶级学术会议的认可,未来或将成为长上下文推理系统的标准组件。

对于关注大模型落地的工程师和研究者,建议深入阅读论文中的离线画像方法与凸包松弛实现细节。在实际部署中,LU-KV的低开销特性使其适合集成到推理加速管线中,尤其适用于需要处理超长文档、多轮对话或代码库的场景。随着上下文窗口进一步扩展,KV缓存管理的精细化将成为必然趋势,而全局优化视角的普及,也将推动压缩算法从“剪枝”向“资源调度”演进。