今日,美团正式将LongCat-2.0模型以MIT许可完全开源,同步公开模型权重与推理代码。这是国内大厂首次在SWE-bench Pro这一权威智能体编程评估上超越GPT-5.5的开源模型——59.5分对58.6分,数字背后意味着开源社区在Agentic Coding领域终于站到了与顶级闭源模型几乎平等的位置。
LongCat-2.0采用MoE(混合专家)架构,总参数量高达1.6万亿,每个token仅激活约480亿参数,兼顾推理效率与模型容量。其核心技术创新集中在三个方面:LongCat Sparse Attention实现高效长文本处理,支持1M token上下文窗口;Zero-Compute Experts动态激活33B–56B的参数范围,但通过设计避免了传统MoE中的无效计算浪费;MOPD(Multi-Objective Partitioned Decoding)则根据任务类型将专家分为Agent、Reasoning、Interaction三组,由路由机制动态调配,确保不同场景下的计算资源精准匹配。
Benchmark成绩进一步验证了其综合实力。除了SWE-bench Pro的59.5,LongCat-2.0在Terminal-Bench 2.1拿下70.8,SWE-bench Multilingual达到77.3,而专注长文档检索的FORTE和RWSearch分别为73.2和78.8,网页浏览理解测试BrowseComp录得79.9。这些指标覆盖了从代码生成、多语言工程到复杂信息检索的多个维度,表明该模型并非仅在单一任务上过拟合,而是在Agent能力上实现了系统性提升。
值得关注的是,LongCat-2.0原生集成了Claude Code、OpenClaw、Hermes Agent等主流智能体工具,并已在国内大规模GPU/NPU集群上完成部署验证。MIT协议下没有任何商用限制,这直接降低了企业级Agent应用的开发门槛。此前,开源模型在Agent Coding领域往往落后闭源模型10%以上,LongCat-2.0的发布意味着团队可以基于完全开放的模型构建生产级的代码智能体,不必再依赖API或承担高昂的授权成本。
从行业角度看,这一事件标志着两个趋势的交叉:一是MoE架构从学术实验走向工业级Agent落地,二是开源模型在特定高难度任务上的竞争力已逼近甚至超越闭源标杆。对于正在搭建AI编码助手的团队,LongCat-2.0提供了一个“开箱即用”的基座,其1M上下文长度尤其适合大型代码库的上下文理解。建议开发者优先尝试其在SWE-bench相关的推理场景,并结合自身工具链(如Hermes Agent)进行定制,这可能是当前成本效益最高的Agent开发路径之一。