美团开源1.6T MoE模型LongCat-2.0,SWE-bench Pro首超GPT-5.5

美团今日宣布完全开源LongCat-2.0,采用MIT许可协议,同步公开模型权重与推理代码。这不仅是国内大厂首个在代码智能体核心基准SWE-bench Pro上超越GPT-5.5的开源模型(得分59.5 vs 58.6),更以极宽松的许可证为agentic coding团队提供了可直接落地的技术底座。

核心架构突破:1.6T MoE的高效之道。LongCat-2.0总参数量达1.6T,但采用混合专家(MoE)设计,每次推理仅激活约48B参数——这与同等吞吐量的dense模型相比,推理成本低一个数量级。技术亮点包括三项:LongCat Sparse Attention通过稀疏注意力机制高效处理1M token超长上下文,兼顾局部依赖与全局信息;Zero-Compute Experts动态选择33B–56B专家激活,消除冗余计算;MOPD(Multi-Objective Pathway Design)按任务路由至Agent、Reasoning、Interaction三组专家,使模型在代码生成、推理任务与交互对话间自动切换最优路劲。

基准成绩全面超越。除SWE-bench Pro(59.5)外,在Terminal-Bench 2.1上取得70.8分,SWE-bench Multilingual达77.3,FORTE 73.2,RWSearch 78.8,BrowseComp 79.9。这些分数不仅显著超越近期开源模型,部分甚至对标GPT-5.5,尤其是在多语言代码修复、长上下文检索与复杂浏览任务上表现突出。值得注意的是,SWE-bench Pro测试的正是真实GitHub Issue修复与PR生成能力,直接反映模型在agentic coding场景中的实用度。

生态与部署。LongCat-2.0原生集成Claude Code、OpenClaw、Hermes Agent等业界知名agent框架,开发者可直接调用形成自动化编码流水线。支持GPU和NPU两种硬件后端,且已在大规模国内集群完成验证——这意味着企业对国产算力的兼容性不再是障碍。对于关注AI编码工具链的团队,这一开源动作几乎消除了“试用-集成-生产”的门槛。

行业转折点已来。此前,开源模型在代码智能体领域长期落后闭源模型,尤其在需要多步推理、工具调用和长上下文协作的任务上差距明显。LongCat-2.0的发布证明:MoE架构配合有效的稀疏注意力与专家路由,完全可以在成本可控的前提下追平甚至超越最先进的闭源模型。MIT许可更意味着无“小模型使用条款”的掣肘,企业可自由修改、分发、商业化。对于正在选型底层代码模型的开发团队,LongCat-2.0值得立刻下载验证——毕竟,在agentic coding这个赛道上,能直接生产可用PR的模型,比任何benchmark排名都更具说服力。