当国产大模型还在“千亿俱乐部”内卷时,美团将战火烧到了万亿参数级,而且是在完全国产化算力集群上完成。6月30日,美团正式发布LongCat-2.0,这一总参数达1.6万亿、每次推理平均激活约480亿参数的模型,不仅开源全部权重,更以原生1M超长上下文和动态专家架构,精准切入Agentic Coding这一高价值场景。它并非实验室里的技术白皮书——OpenRouter上全球月调用量已冲至前三,证明它是被开发者“用脚投票”的生产力工具。
技术架构是LongCat-2.0最硬核的底色。它抛弃了传统的稠密Transformer,转而采用LSA稀疏注意力机制处理超长序列,配合零计算专家(Zero-Compute Expert)策略,在保持1M上下文无损的同时,将推理预算控制在合理范围。而ScMoE(稀疏条件混合专家)与MOPD(多专家融合)的协同设计,让模型内部运行着三组专职专家团——Agent、Reasoning、Interaction——分别对应工具调用、逻辑推理和人机交互。这种“按需激活+专家协同”的思路,与DeepSeek-V2、Mixtral等模型相比,更强调面向Agent场景的微调弹性,而非盲目堆叠专家数量。
评测数据印证了这种设计的方向性正确。在针对编程Agent的SWE-bench Pro上,LongCat-2.0拿下59.5分,而SWE-bench Multilingual(多语言版本)更是达到77.3分——这已接近甚至超越部分闭源模型在同类任务上的表现。要知道,SWE-bench考察的是模型自主定位bug、修改代码、通过单元测试的端到端能力,而非简单的代码补全。对于追求“修复一个真实GitHub Issue”的工程团队来说,59.5分意味着模型已经具备相当的实用价值。更值得关注的是,美团将其以预览版形式通过OpenRouter和longcat.ai开放后,月调用量迅速跻身全球前三——这既是社区对效果的验证,也从侧面表明开源生态对模型供应方“能用、可跑、不虚标”的迫切需求。
从行业角度看,LongCat-2.0的发布有三重信号。第一,国产算力(五万卡集群)已能支撑万亿参数模型的全流程训练与推理,此前依赖海外生态的瓶颈正在被打破。第二,1M原生上下文与稀疏注意力结合,使得长代码仓库、多文件联动的Agent场景不再是空中楼阁,这直接服务于DevOps自动化、智能IDE等领域的商业化落地。第三,开源+高调用量模式让“模型即产品”成为现实——开发者不再被动等待厂商更新API,而是可以本地部署、微调、甚至剪枝,真正掌握模型生命周期。对于瞄准AI编程赛道的创业团队和企业来说,LongCat-2.0现在就是一个可以立刻投入实验的基座,远比等待“下一个GPT-5”来得务实。趋势上,随着更多类似模型在国产算力上生长,Agentic Coding将从少数巨头的Demo游戏,演变为开源社区的集体工程实践——这也正是LongCat-2.0可能被记住的原因:它不是最快的,但它是第一个在万亿参数级别真正“跑通”的国产开源选择。