美团LongCat-2.0开源:1.6T MoE模型首超GPT-5.5,Agent编程新标杆

美团宣布LongCat-2.0完全开源,采用MIT许可协议,开放模型权重与推理代码。该模型以MoE架构为核心,总参数量1.6T,每token激活约48B,并支持1M token上下文。这一发布不仅填补了国内大厂在超大规模MoE开源模型上的空白,更在关键编码基准上首次超越闭源标杆——SWE-bench Pro得分59.5,高于GPT-5.5的58.6,同时SWE-bench Multilingual达77.3,Terminal-Bench 2.1为70.8。这意味着开发agentic code工具链的团队,可以直接获取一个经过验证的、无使用限制的基础模型。

LongCat-2.0的技术架构包含三个核心创新:LongCat Sparse Attention通过稀疏注意力机制处理长文本,在1M上下文时保持高效计算;Zero-Compute Experts在推理时动态激活33B–56B专家参数,实现“零浪费计算”——未激活专家不消耗算力;MOPD(Multi-Objective Policy Distillation)按任务类型将专家分为Agent、Reasoning、Interaction三组,由路由动态选择。这种设计使其在编程、多轮交互和复杂推理场景下,都能以约48B的激活参数逼近甚至超越更大密集模型的性能。

Benchmark成绩进一步证实其通用性:RWSearch 78.8、BrowseComp 79.9、FORTE 73.2,覆盖搜索、浏览和工程任务。原生集成Claude Code、OpenClaw、Hermes Agent等工具,并已在GPU与NPU集群经过大规模国内部署验证,降低了实际落地的硬件门槛。MIT协议允许商用、修改甚至二次发布,与常见限制性开源协议形成鲜明对比。

从行业视角看,LongCat-2.0的出现是一个转折点。此前在SWE-bench Pro上超越GPT-5.5的开源模型多为海外版本,且通常附带非商业条款。美团此次开放全权重,无异于向agentic coding社区提供了一份可直接用于生产环境的“参考实现”。对于正在搭建AI编程代理、自动化测试或代码审查工具的团队,建议立即下载并评估其对特定代码库的适配表现;研究侧则可重点分析MOPD的专家路由机制,探索任务特定微调的可能性。随着1M上下文和超大规模MoE的开源化,模型即工具的边界正在模糊,LongCat-2.0是这一趋势的鲜明注脚。