大模型长上下文推理的核心瓶颈之一,是KV Cache带来的显存爆炸与延迟增长。传统压缩方法多基于单步或局部注意力分数进行预算分配,如SnapKV、KeyDiff等,虽有效但难以捕捉长期依赖下的边际效用变化。百度百舸团队与复旦大学合作提出的Long-horizon Utility KV(LU-KV)框架,将这一问题重新定义为面向长程边际效用的全局组合优化,从根源上提升了缓存分配的效率与鲁棒性。相关论文已被ICML 2026接收。
LU-KV的关键创新在于将“头级”KV Cache预算分配建模为全局优化问题,而非逐层或逐个token的局部决策。其技术路线包含三个组件:首先,通过离线画像估计每个注意力头在不同上下文长度下的边际贡献曲线,即“该头多保留一个token能带来多少推理收益”;其次,利用凸包松弛将原NP-hard的整数规划问题转化为可求解的连续形式;最后,采用基于边际效用的贪心求解器,在低开销下逼近最优分配。
这一设计使得LU-KV并非某种独立的压缩算法,而是一个可插拔的预算分配层,能够与SnapKV、KeyDiff、H2O等主流方法结合。实验结果显示,在LongBench和RULER两个长上下文基准上,80%压缩比下性能损失极小,显存占用降低40%以上,推理延迟同步下降。尤其在高压缩比(如85%)时,传统方法会出现明显的质量崩塌,而LU-KV仍能保持相对稳定的输出,原因在于其全局视角避免了局部最优导致的“关键token集体丢失”。
从行业视角看,这标志着KV Cache压缩正从“经验性剪枝”向“数学形式化优化”演进。过去多数工作依赖启发式规则(如保留高频注意力头),而LU-KV通过离线画像量化了边际收益,使得分配策略可解释、可复现。对开发者而言,这意味着在部署长上下文应用(如代码库分析、多文档问答)时,可以通过LU-KV替换原有压缩模块,在不重训模型的前提下降低显存门槛,直接受益于大模型上下文长度的扩展趋势。
建议关注以下落地方向:首先,LU-KV的离线画像复杂度与序列长度线性相关,适合先做一次预计算后反复使用;其次,当模型结构更新或应用场景变化时需重新画像,但这一成本远低于重新训练。未来趋势上,随着上下文长度向128K、1M迈进,KV Cache的显存占比将急剧上升,类似LU-KV的全局优化思路可能成为标配——它将“记住什么”的选择权从直觉提升至算法理性,这才是系统优化应有的姿态。