美团LongCat-2.0开源:1.6T MoE模型SWE-bench Pro超GPT-5.5

人工智能编程智能体(Agentic Coding)赛道迎来关键变量。美团正式开源其LongCat-2.0模型,这是国内主要科技公司首个在SWE-bench Pro基准上超越GPT-5.5的开源大模型。采用MoE(混合专家)架构,总参数量高达1.6T,但每处理一个token仅激活约48B参数,搭配1M token的超长上下文窗口,为复杂软件工程任务提供了新的基础能力。

LongCat-2.0在架构层面进行了多处针对性的效率优化。其LongCat Sparse Attention机制专为长文本场景设计,能有效压缩计算开销,使得1M context在推理时仍保持合理速度。更为亮眼的是Zero-Compute Experts技术:通过动态评估,每token仅激活33B–56B参数,且完全避免冗余计算,实现了“零浪费”的专家激活。此外,MOPD(多目标专家路由)根据任务类型自动将token路由至Agent、Reasoning、Interaction三组专家集群,使模型在不同场景下都能调用最擅长的子网络。

基准测试成绩支撑了上述设计的效果。在软件工程能力评估上,SWE-bench Pro达到59.5(超越GPT-5.5的58.6),SWE-bench Multilingual取得77.3,FORTE得分73.2。在终端任务Terminal-Bench 2.1上获得70.8,而网页浏览与代码搜索任务BrowseComp和RWSearch分别达到79.9和78.8。这些数字显示LongCat-2.0不仅在编程修改,也在多语言适应、复杂工具调用等方面展现出全面性。

为降低落地门槛,该模型原生集成了Claude Code、OpenClaw、Hermes Agent等主流智能体工具,并提供完整的推理代码与权重。部署层面同时支持GPU和NPU,且已在美团大规模国内集群中得到验证。MIT许可协议意味着无论学术还是商业用途均无限制。

此次开源的最大价值在于为Agentic Coding团队提供了一个“开箱即用”的强基座。以往在SWE-bench这类高难度编程评测上,开源模型往往落后闭源模型一个身位,而LongCat-2.0以明确优势反超,标志着开源生态在复杂软件工程能力上迈入新阶段。对于正在构建代码智能体或智能编程助手的开发者,这是一个可以直接投入生产评估的选项。