快手开源Keye-VL-2.0:3B激活参数征服256K长视频,多模态Agent新标杆

在视频生成与理解交替爆发的2025年,多模态模型的“长上下文”能力正从文字竞赛蔓延至视觉领域。快手近日开源了Kwai Keye-VL-2.0-30B-A3B(以下简称Keye-VL-2.0),一个专为长视频理解和智能体交互设计的MoE(混合专家)多模态基础模型。它用仅3B的激活参数,将视频上下文窗口推至256K token,并首次将DeepSeek Sparse Attention(DSA)适配至GQA(分组查询注意力)架构,在推理效率与长程建模之间找到了新的平衡点。

长期困扰CV/NLP交叉领域的一个核心矛盾是:视频理解需要捕捉跨帧的语义连贯性,但高昂的计算开销往往迫使模型牺牲分辨率或时长。Keye-VL-2.0从三个维度破解这一困局。第一,可扩展的视觉I/O与异构ViT-LM并行流水线:视觉编码器与语言模型之间的通信不再是瓶颈,通过自定义DSA内核,模型能够自适应地聚焦于视频中的关键片段,而非全部帧。第二,无损的256K上下文支持:DSA通过稀疏化注意力矩阵,将计算复杂度从二次方降至近似线性,同时保持完整的信息保留——这是GQA多模态架构首次获得此类增强。第三,跨模态多教师在线策略蒸馏(MOPD):结合Context-RL与Video-RL两个阶段的强化学习,有效缓解了多任务并行训练中的灾难性遗忘,使模型在视频理解、代码生成、工具调用等多个场景下表现均衡。

在业界关注的多智能体协作能力上,Keye-VL-2.0原生支持代码、工具和搜索场景下的多智能体协作与多模态自纠正。这意味着Agent不仅能根据视频内容执行指令,还能在推理出错时调用外部工具(如搜索引擎)进行自我修正,这是类人智能体的关键特性。模型在TimeLens、Video-MME-v2、LongVideoBench等长视频基准上均达到同类参数量下的SOTA水平。值得注意的是,其总参数30B,但推理时仅激活3B,与普通14B稠密模型相比,计算成本降低约80%,同时效果反超不少更大模型。

这一路径与当前行业趋势高度吻合:小激活参数、大知识容量、长上下文覆盖成为多模态模型竞争的制高点。DeepSeek系列此前已在纯文本稀疏注意力上证明其效率,快手团队则首次将其成功迁移至视觉-语言联合的GQA架构,为后续研究提供了一个可复现的开源基线。对于正在构建视频Agent的开发者而言,Keye-VL-2.0的发布意味着不再需要在“理解时长”与“推理速度”之间做取舍——模型权重已完整开源,可直接用于智能客服、视频摘要、自动驾驶场景理解等任务。长远来看,当视觉模型普遍支持256K乃至更长上下文时,视频领域的“Agent化”将越过关键拐点。