国产算力万亿参数大模型来了:美团开源LongCat-2.0,这盘棋有点大

大模型行业的“亿”级竞争,正悄然升级为“万亿”级。不过,与许多只停留在参数噱头、依赖海外算力堆叠的模型不同,美团的LongCat-2.0拿出了实打实的技术筹码和落地成绩。它在6月30日正式开源,全流程训练与推理均在五万卡国产算力集群上完成,这本身就是对国产AI基础设施严谨性的一次验证。

从核心指标看,LongCat-2.0总参数量为1.6T,平均每步推理激活约48B参数。这种稀疏MoE(混合专家)范式如今已是万亿模型的标配策略,但LongCat-2.0的特别之处在于它的架构微创新。它引入了LSA稀疏注意力机制,旨在解决原生支持1M超长上下文时常见的高昂计算成本问题。更重要的是,其ScMoEMOPD多专家融合设计,专门划分了近三组动态专家——Agent、Reasoning、Interaction。这种分组并非简单的参数堆叠,而是一种场景导向的架构优化,意图让模型在处理不同复杂推理与工具调用任务时,自动调度最合适的专家子网,从而提升编译与推理效率。

测评数据印证了它在聚焦场景中的硬实力:在SWE-bench Pro上拿到59.5分,在SWE-bench Multilingual上更达到77.3分。SWE-bench系列评测覆盖从单个代码库的补丁生成到多语言环境下的全流程修复,能实测模型在真实编程场景中的持续推理准确性。对比当前主流开源编码模型,LongCat-2.0在针对复杂环境的精确生成能力上已形成明显优势。所谓“不是一个Demo,是生产力”,意味着它可以被直接嵌入版本的代码库,自动完成增补与修改,降低工程师的重复劳动成本。

更重要的是,LongCat-2.0预览版已通过OpenRouter和longcat.ai开放,其月调用量已冲至OpenRouter全球前三。OpenRouter是业界多家大模型推理的聚合平台,调用量排名本质上是“开发者用脚投票”的结果。长期占据前几位的通常是GPT-4、Claude等闭源旗舰,LongCat-2.0的突然闯入,意味着海外开发者在实际的Agentic Coding场景中,已经逐步认可其可用性和性价比。这为国内大模型打破“强参数弱应用”的魔咒提供了绝佳案例。

对国内AI生态而言,LongCat-2.0的发布,最值得关注的并非参数本身,而是它印证了“算力可解”这一命题。用国产芯片体系完成万亿参数模型的全流程训练推理,且产出能直接投入生产,这算是消除了行业对国产算力“能用但不好用”的长期顾虑。未来一段时间,预计会有更多国内大厂跟进开源各自的稀疏MoE模型,并围绕具体的领域编程、长文档推理和Agent交互做出更深层次优化。

对于开发者与公司团队,建议尽快在OpenRouter上体验LongCat-2.0的Agentic Coding能力,并将它作为你内部自动编程流水线的候选模型之一。当每个万亿参数模型都能针对具体任务完成精细推理,工程师的终极使命,或许将是思考如何让更多Agent工具并行互调,而非亲自一行行写代码。