大模型长上下文推理面临着日益严峻的显存瓶颈:随着序列长度扩展至128K甚至1M以上,KV Cache的存储开销呈线性增长,直接制约了部署效率与成本。传统压缩方法(如SnapKV、KeyDiff)采用基于注意力分数或历史影响的局部启发式分配,虽能缓解压力,却忽略了注意力头之间在长程上下文中的边际效用差异,导致预算配置陷入局部最优。
百度百舸团队与复旦大学合作提出的Long-horizon Utility KV(LU-KV)框架,从根源上重新定义了问题范式。该框架将头级KV Cache预算分配建模为面向长程边际效用的全局组合优化问题——不再为每个头独立分配静态比例,而是综合考虑各注意力头在不同上下文长度上的贡献曲线,通过全局规划实现预算利用效率的最大化。LU-KV的核心技术栈包括三项创新:第一,离线画像阶段,通过对注意力头随序列长度演变的边际贡献进行统计建模,构建出每个头的边际效用曲线;第二,凸包松弛技术,将离散的预算分配空间转化为连续凸优化问题,避免暴力搜索;第三,基于边际效用的贪心求解器,在较低计算开销下逼近全局最优解。整套流程可在模型推理前完成配置,不影响在线响应速度。
在LongBench与RULER两类长上下文基准测试中,LU-KV在80%压缩比下的性能损失控制在极小范围内。相比传统按注意力分数分级的策略,LU-KV在同一压缩比下平均性能提升约3~5个百分点击点,同时将KV Cache显存占用降低至原来的五分之一,推理延迟也获得相应改善。尤其值得关注的是,LU-KV的框架设计具有通用适配能力——它不依赖特定压缩算法的内部机制,可作为“上层优化器”与SnapKV、KeyDiff、H2O等方法无缝协作,进一步释放它们的压缩潜力。
这一成果被ICML 2026录用,标志着学术界对组合优化视角的认可。从行业角度看,长上下文模型(如GPT-4-128K、Claude 100K)正在加速进入生产环境,而KV Cache的显存效率直接决定了服务成本与可扩展性。LU-KV所倡导的“以全局边际效用替代局部分数”的思路,很可能成为未来KV Cache管理工具链的标准组件。对于从事长上下文推理工程优化的团队而言,深入理解LU-KV的离线画像与贪心求解机制,并将其集成到现有压缩流程中,是一条切实可行的降本路径。可以预见,随着模型上下文长度继续增长,从“分头独立管理”走向“全局协同优化”将是不二之选。