快手今日正式开源 Kwai Keye-VL-2.0-30B-A3B,这是一个面向长视频理解与智能体协作的混合专家多模态基础模型。在总参数量30B的前提下,每次推理仅激活3B参数,却将上下文窗口扩展至256K tokens,且实现了无损处理——这一突破直接指向当前多模态模型在长视频场景下的核心瓶颈:计算开销与上下文长度的矛盾。
模型的核心创新在于首次将 DeepSeek Sparse Attention (DSA) 移植到分组查询注意力(GQA)架构中。传统多头注意力处理长序列时,注意力矩阵随序列长度平方增长,而DSA通过稀疏化注意力掩码,在保持建模能力的前提下将复杂度降至线性。这一适配并非简单替换:团队同时优化了视频I/O管线、异构ViT与语言模型端并行策略,并定制了DSA内核,最终在256K序列上实现了吞吐量与计算开销的平衡。相比此前多数模型仅支持8K-32K上下文(如LLaVA-NeXT系列),Keye-VL-2.0的256K意味着能够一次性处理超过10分钟的高清视频帧。
在训练方法论上,快手提出 跨模态多教师在策略蒸馏(MOPD),结合上下文强化学习与视频强化学习,缓解多任务对齐中的灾难性遗忘。具体而言,MOPD从不同模态的教师模型中蒸馏知识,并利用策略采样进行在线优化——这有别于常规的离线知识蒸馏。双重RL则分别针对时序上下文理解(Context-RL)和视频级动作规划(Video-RL),使模型既能定位长视频中的关键帧,又能为智能体任务(如代码执行、工具调用)生成多步推理。模型原生支持多智能体协作与多模态自纠正,例如在视觉问答中若检测到初始答案置信度低,可主动调用搜索工具或切换视角重新分析。
基准测试结果佐证了这一路线的有效性:在 TimeLens(长时事件定位)、Video-MME-v2(多模态理解)、LongVideoBench(长视频推理)等数据集上,Keye-VL-2.0以3B激活参数达到了同类规模最佳水平,甚至在某些指标上接近7B-13B激活参数的模型。这得益于MoE架构的路由效率——每个token仅激活部分专家,配合稀疏注意力,使得实际计算量远低于全参数模型。
从行业角度看,Keye-VL-2.0填补了两个空白:一是长视频理解模型往往因上下文限制而被迫采用分段分析,导致时序关系丢失;二是视频智能体(Video Agent)此前多依赖外部记忆模块或分步重采样,模型本身缺乏原生长程推理能力。快手将权重开源,意味着开发者可以直接基于该模型构建视频摘要、自动化剪辑、监控分析等应用,无需负担全参数部署的算力成本。
对于关注视频智能体的团队而言,建议优先测试其在以下场景的表现:需要多轮交互的视频问答(例如“从第5分钟开始,演示者换了几次工具?”)、复杂事件推理(如“事故发生前有哪些征兆?”)以及多智能体协作任务(多个Agent分别处理视频、代码和数据库)。同时需注意,模型虽支持128K默认上下文,但256K模式需依赖定制内核与足够显存(至少A100-80GB级别),实际部署时应根据视频时长选择合适长度。
未来,随着稀疏注意力与MoE在多模态领域的进一步融合,3B激活参数覆盖256K上下文将不再是孤例。快手此举加速了从“短片段理解”到“完整叙事理解”的范式迁移,也为视频智能体从研究原型走向工程落地提供了可信赖的基础设施。