1.6T参数全面开源,美团LongCat-2.0为何能超越GPT-5.5?

国内大模型开源阵营迎来一个标志性节点。美团正式以MIT许可协议完全开源LongCat-2.0,包括完整模型权重与推理代码,模型总参数量达到1.6T,采用MoE架构每token仅激活约48B参数,同时支持1M token超长上下文。在SWE-bench Pro评测中,LongCat-2.0以59.5分超越GPT-5.5的58.6分,这是国内大厂开源模型首次在该基准上实现对GPT-5.5的超越。

技术架构层面,LongCat-2.0整合了三项关键创新。首先是LongCat Sparse Attention机制,专门针对1M超长上下文优化,能够高效处理token序列中的稀疏注意力模式,大幅降低计算复杂度。其次是Zero-Compute Experts动态激活策略,在推理时根据输入需求动态选择33B至56B的专家参数,实现零浪费计算,这在实际部署中意味着更低的延迟和更高的吞吐。第三是MOPD(Mixture of Programming Domains)路由机制,将模型内部专家划分为Agent、Reasoning、Interaction三组,根据任务类型自动路由到最合适的专家组合,这种面向任务的结构化设计让模型在不同编程场景下表现出差异化优势。

基准测试成绩印证了这套架构的有效性。除了SWE-bench Pro的59.5分外,LongCat-2.0在Terminal-Bench 2.1上获得70.8分,SWE-bench Multilingual达到77.3分,FORTE、RWSearch、BrowseComp分别为73.2分、78.8分和79.9分。值得注意的是,这是一组面向真实软件工程场景的评测集合,涵盖代码生成、调试、搜索、浏览代理等多种agentic任务能力,而非传统填空式代码评测,其性能更具实际参考价值。

生态兼容性是LongCat-2.0的另一大亮点。模型原生集成了Claude Code、OpenClaw、Hermes Agent等主流agent框架工具,并支持GPU与NPU双平台部署,已在大规模国内集群完成验证。这意味着团队无需额外适配即可在现有agentic coding工作流中直接替换使用,MIT许可协议更消除了商业使用层面的任何限制。

开源策略的转变值得关注。此前国内大模型开源多集中在通用对话或基础推理能力上,而LongCat-2.0直接切入agentic coding这一高价值垂直场景,且以零限制协议开放。对于正在搭建自动化编程pipeline的团队而言,这提供了一个可直接投入生产的基座模型。从行业视角看,当开源模型在专业软件工程基准上开始超越闭源标杆,技术选型的天平正在发生实质性倾斜。未来agentic coding能力的竞争,很可能从模型参数比拼转向工程集成与场景深挖。