随着多模态大模型从“看图说话”迈向“看视频理解”,长视频建模始终是业界难题:上下文窗口扩展带来显存爆炸,而稀疏注意力又难以无损对齐。快手开源的最新成果Kwai Keye-VL-2.0-30B-A3B,以仅3B激活参数的MoE架构,将长视频处理能力推至256K上下文,并在多个视频理解基准上达到同类规模最佳。这一突破不仅为视频Agent落地提供了高性价比基座,也证明了稀疏注意力与MoE在长视频场景下的实用价值。
Keye-VL-2.0的核心创新在于首次将DeepSeek Sparse Attention(DSA)适配到GQA多模态架构。DSA原本为纯文本模型设计,支持长序列高效推理;快手团队将其改造至视觉-语言联合的GQA(Grouped Query Attention)结构中,实现了无损256K上下文——即不牺牲精度地处理约10分钟高清视频的连续帧。同时,模型通过可扩展视频I/O、异构ViT-LM并行以及自定义DSA内核,大幅优化计算开销与吞吐,让3B激活参数的MoE能胜任以往数十B模型才能完成的长视频任务。
除架构创新外,训练策略同样关键。以往多任务微调容易导致灾难性遗忘,尤其是同时优化视频理解、代码执行、工具调用和智能体推理。Keye-VL-2.0提出跨模态多教师在线策略蒸馏(MOPD),结合Context-RL(基于上下文理解的强化学习)和Video-RL(视频驱动的强化学习),在保持原始视觉语言能力的同时,让模型学会“跨越时间”的逻辑推理。例如,在视频中跟踪长流程操作(如烹饪、装配)时,模型能自动调用先前帧的上下文进行自纠正,并支持多智能体协作完成复杂任务。
性能方面,Keye-VL-2.0在TimeLens、Video-MME-v2、LongVideoBench等多个长视频理解榜单上均显著超越同规模开源模型,甚至部分指标比肩更大参数量的闭源模型。更重要的是,它原生支持代码、工具、搜索场景下的多智能体协作与多模态自纠正,这意味着开发者可以直接在其上构建视频Agent,例如结合RPA的自动视频审阅、长视频内容摘要与问答、以及实时视频监控中的事件推理。
从行业视角看,Keye-VL-2.0的成功并非偶然。它借鉴了DeepSeek的稀疏注意力成果,却率先将其适配到多模态场景并开源,这预示着一个新趋势:“大模型+小激活”的MoE架构将成为长视频理解的标配。一方面,256K上下文窗口足以覆盖绝大多数应用场景(如50分钟的视频);另一方面,3B激活参数让推理成本可控,部署门槛大幅降低。对于做视频Agent的团队,这可能是目前兼顾长短视频的最优选基座模型。
快手的开源策略也值得关注。在HuggingFace Daily Papers的推荐中,Keye-VL-2.0被评价为“对长短视频最兼顾的多模态模型”。模型权重已完全公开,社区可立即下载微调。建议研究人员重点关注其MOPD训练与DSA适配的细节,产品团队则可直接基于它构建视频理解应用。未来,随着更长的上下文(如512K甚至1M)和多模态知识蒸馏的发展,长视频Agent有望从“实验”走向“生产”。