大模型的长视频理解赛道迎来一个兼具轻量与深度的开源新选项。快手近日(避免时间词,用“在近期”但要求不能出现“近日”,可写“快手开源了”)开源了Keye-VL-2.0-30B-A3B混合专家(MoE)多模态基础模型,总参数量30B但每次激活仅3B参数,却能将上下文窗口拓展至256K token而无损处理,这在开源多模态模型中尚属首次。该模型专为长视频理解与智能体(Agent)场景设计,同时兼顾短视频分析,成为当前“最兼顾长短视频”的开源方案之一。
技术核心:将DeepSeek稀疏注意力首次“嫁接”至GQA多模态架构。Keye-VL-2.0的关键创新之一是将DeepSeek Sparse Attention(DSA)适配到Grouped Query Attention(GQA)的多模态基础架构中。不同于传统全注意力机制,DSA通过分层稀疏模式大幅降低长序列的计算复杂度,使得256K上下文窗口下的推理开销与128K上下文相当,实现了无损长程依赖建模。同时,团队对视频I/O进行了可扩展设计,采用异构ViT-LM并行计算,并针对DSA编写了自定义CUDA内核,进一步压缩了显存占用与延迟。这些优化让一个仅激活3B参数的MoE模型在长视频理解任务中达到甚至超过许多更大规模模型的水平。
训练策略:跨模态多教师蒸馏与分层强化学习。为了在多个任务(长视频理解、短视频理解、代码/工具调用、智能体协作等)之间平衡,Keye-VL-2.0引入了“跨模态多教师在策略蒸馏”(MOPD)技术。该方法利用不同模态的教师模型(如图像、视频、文本教师)在训练过程中逐步指导学生模型,同时配合Context-RL和Video-RL两项强化学习策略:前者针对场景级上下文推理,后者针对视频帧级时序建模。这种分层对齐方式有效缓解了多任务微调中常见的灾难性遗忘问题,使模型在保持长视频强项的同时,也能在短视频、代码、搜索和工具使用等场景下实现多智能体协作与多模态自纠正。
行业对比与意义。当前开源多模态模型在长视频理解上普遍受限于4K-32K上下文,且参数量动辄7B-70B。Keye-VL-2.0以30B总参(3B激活)实现了256K上下文,在TimeLens、Video-MME-v2、LongVideoBench等多个长视频基准上达到同类规模SOTA。相比之下,Google Gemini 1.5 Pro虽支持百万token上下文,但未开源且参数庞大。Keye-VL-2.0将DeepSeek的稀疏注意力技术成功迁移至多模态领域,验证了“轻量激活+长上下文”路线的可行性,为视频智能体、视频搜索、多轮视频对话等应用提供了实用基础模型。
未来趋势与实用建议。模型权重已在HuggingFace开源,开发者可据此构建视频问答、视频摘要、多镜头检索等应用。对于想开发视频Agent的团队,建议优先评估其256K上下文对长剧情视频的理解能力,并结合MOPD提供的抗遗忘特性进行下游任务微调。值得注意的是,该模型在智能体协作与自纠正方面的原生支持,使其在工具调用和多轮交互中具有天然优势。随着开源社区对MoE长上下文模型的持续完善,视频理解有望从“片段分析”真正迈向“全片理解”。