当全球开源大模型竞赛已进入“千亿参数俱乐部”的白热化阶段,德国AI研究者选择了一条截然不同的路径:不做参数堆砌,而是用架构创新实现效率突围。7月14日,由德国AI协会协调的研究联盟正式开源大语言模型Soofi S 30B-A3B,这款模型最引人注目的不是参数规模,而是其独特的Mamba-Transformer混合MoE架构。
Soofi S的参数规模为316亿(总参数量),但每个token仅激活约32亿参数,这意味着它在推理时相当于一个约3B的模型。按照当前行业通行说法,该模型属于“30B级”范畴,但其实际计算开销远低于同级稠密模型。根据官方数据,在4万token上下文长度下,Soofi S的生成吞吐量约为同规模稠密模型的8倍。对于需要处理长文档、代码库或科研论文的AI应用场景,这一性能优势具有显著的实用价值。
在架构层面,Soofi S并非简单将Mamba-2和标准注意力层进行拼接,而是采用了混合MoE设计:主干网络以Mamba-2的状态空间模型(SSM)结构为主,仅在特定层中保留标准Transformer注意力机制。这种“选择性注意力”的设计理念与当前学术界“用SSM替代注意力”的激进路线形成微妙平衡——既保留了SSM的高吞吐和线性复杂度优势,又避免了其在复杂推理任务中的性能瓶颈。
在基准测试中,Soofi S的表现印证了这一设计方向的可行性:在HumanEval(代码生成测试)上得分73.8%,MBPP(程序合成测试)得分为70.2,德语版MBPP更是高达84.2。值得注意的是,在所有完全开源模型中,Soofi S的英语和德语综合得分均位列第一,超越了OLMo 3 32B和Apertus 70B,其中Apertus 70B参数规模是Soofi S的两倍以上。
这一结果的背后是数据策略的针对性优化。Soofi S的训练完全在德国电信慕尼黑工业AI云上进行,其训练数据中德语占比从第一阶段的7.2%提升至第二阶段的15.3%。这一渐进式增加德语数据比例的做法,有效平衡了模型在多语言通用能力与德语专项性能之间的权衡。对于需要处理德语法律文本、技术文档或金融报告的B端用户而言,Soofi S提供了当前开源社区中最优的德语AI基座。
从行业角度来看,Soofi S的发布释放了两层信号:第一,状态空间模型(SSM)正在从学术实验走向工程落地,其长上下文高吞吐的优势恰好切中了当前AI应用中的核心痛点——传统Transformer模型在长序列处理时的O(n²)复杂度已成为瓶颈。第二,开源AI社区正在发生架构分岔,不再一味追求参数规模的军备竞赛,而是开始探索“小模型+高效架构”的性价比路线。
对于中文开发者而言,Soofi S的权重已在开源社区公布,可直接用于微调或推理。尽管德语是其强项,但Mamba-Transformer混合架构在中文长文本场景下同样具有可复用的技术路径,值得跟踪关注。未来,如果类似思路被用于中文大模型,我们很可能会看到一批在长文档处理、代码生成、合同分析等垂直场景中表现出色的高效模型涌现。