快手开源Keye-VL-2.0:仅3B激活参数实现256K长视频理解,首创DeepSeek稀疏注意力适配

多模态大模型的“长视频”赛道迎来关键突破。快手研究团队开源的Keye-VL-2.0-30B-A3B(以下简称Keye-VL-2.0),以MoE架构仅激活3B参数,却实现了对256K上下文长度的无损支撑——这一数据远超当前主流视频模型(通常为128K或64K)。模型同时将DeepSeek Sparse Attention(DSA)首次适配到GQA(Grouped Query Attention)多模态架构中,为长视频理解与智能体场景提供了兼顾效率与性能的解法。

技术核心:稀疏注意力与MoE的协同优化
Keye-VL-2.0采用30B总参数、每次仅激活3B的稀疏MoE设计。但真正让它在长视频中脱颖而出的,是对DeepSeek Sparse Attention(DSA)的定制化适配。DSA原本为纯文本模型设计,Keye团队通过改造GQA多头注意力结构,使稀疏注意力可以无损失地处理视觉与文本令牌混合的长序列。配合可扩展视频I/O、异构ViT-LM并行计算以及自定义DSA内核,模型在保持256K上下文无损的同时,将推理吞吐量提升了数倍。

这种做法直接解决了长视频模型的两大痛点:显存爆炸(传统全注意力O(n²)复杂度)与长程依赖丢失(常见的下采样或窗口注意力会截断关键信息)。Keye-VL-2.0在TimeLens、Video-MME-v2、LongVideoBench等基准上均达到同类规模(1B~4B激活参数)的SOTA,且在部分指标上超越更大激活参数的模型。

训练策略:多教师蒸馏+强化学习防止灾难性遗忘
多任务对齐是多模态模型的经典难题——新增视频理解任务往往导致代码、工具调用等已有能力退化。Keye团队提出跨模态多教师在策略蒸馏(MOPD),结合Context-RL(上下文强化学习)与Video-RL(视频强化学习)。简单来说:MOPD让模型从多个教师模型中蒸馏不同模态的知识(文本、代码、视觉、工具),同时通过RL信号动态平衡损失,避免因过度优化视频任务而遗忘其他能力。这使得模型原生支持代码生成、工具调用、搜索和多智能体协作场景下的多模态自纠正能力。

应用前景:视频Agent的理想基座
推荐理由中提到“这是目前对长短视频最兼顾的多模态模型”,这一判断基于两个事实:第一,256K上下文意味着可以一次处理约10分钟无压缩视频(以24fps、每帧224×224分辨率估算),无需分段切帧;第二,3B激活参数使得模型可在消费级GPU上部署(如RTX 4090),远低于同类全参数模型所需的A100/H100集群。对于需要实时或近实时视频理解的智能体应用(如视频编辑助手、自动驾驶场景分析、在线教育辅导),Keye-VL-2.0提供了低成本、高精度的基座选择。

趋势判断
Keye-VL-2.0的开源,标志着多模态模型从“用更大参数堆性能”转向“用稀疏架构+高效注意力压榨算力”。它验证了两个方向:一是DeepSeek风格的稀疏注意力完全可迁移至视觉模态;二是MoE+蒸馏+RL的三件套可有效解决多任务灾难性遗忘。对从业者而言,直接下载模型权重进行微调或产品化落地,将是短期内最实际的路线。长远看,长上下文多模态Agent将从“演示”进入“工程化”阶段——Keye-VL-2.0正是这条路上的关键路标。