23B激活参数也能打?MiniMax M3开源模型多模态与成本双突破

在国产大模型开源生态持续升温的背景下,MiniMax(稀宇科技)选择了一条与众不同的路径:它没有简单堆叠参数规模,而是通过稀疏注意力机制与多模态原生预训练的结合,推出一款兼顾性能与效率的基座模型。M3模型以428B总参数、仅23B激活参数的配置,在多个权威评测中取得了开源类目下的第一,其背后的MSA(MiniMax Sparse Attention)架构更是在长上下文计算成本上实现了结构性突破。

多模态从预训练阶段“长在一起” 与多数开源模型先训练纯文本基座、再通过后期微调接入图像能力不同,M3在预训练阶段就进行了文本、图像等模态的交错混合训练。这种“原生多模态”设计意味着模型在理解图文关系时,能够利用联合分布的统计特性,而非依赖事后对齐。对于构建多模态RAG(检索增强生成)、图文对话、视觉Agent等场景的应用团队,M3提供了一个开箱即用的基座,省去了跨模态适配的工程成本。

MSA稀疏注意力:长上下文不再“烧钱” 长上下文推理的一大痛点在于注意力机制的计算量随序列长度平方增长。M3引入的MSA架构,通过动态稀疏化策略,在保持模型精度的同时大幅降低了KV Cache的内存占用和计算开销。这使得长文档理解、多轮对话、长视频解析等场景的部署成本显著下降。MiniMax同步公开了MSA技术论文,为行业提供了可复现的优化思路。

开源两周,榜单成绩验证硬实力 在M3发布两周后,其综合智能指数在Artificial Analysis平台位列开源模型之首;在专注于长文本和知识推理的GDPval-AA排行榜中同样排名第一;Code Arena WebDev榜单中,M3进入帕累托最优序列(即在不牺牲其他能力的前提下达到当前最优覆盖);在国内Vals.AI榜单中居所有国产模型首位。这些成绩表明,M3并非仅靠参数量取胜,而是在通用能力、编码能力、长上下文处理上均具备竞争力。

推理速度大幅提升,工程化能力并进 输出速度方面,M3已从早期约30 TPS(Tokens per second)提升至约80 TPS,MiniMax计划在此基础上再提速30%-40%。这意味着开发者可以在低延迟要求场景(如聊天机器人、实时翻译)中直接使用该模型,而无需额外蒸馏或剪枝。此外,后台新增Token Plan调用量看板,方便用户监控使用情况,进一步降低运维门槛。

国产开源基座的新变量 M3的出现不仅补全了国产开源模型在多模态方向的空缺,更以“高性价比长上下文”给了中小团队一个无需堆算力的选择。当开源模型从“卷参数”转向“卷效率”与“卷原生多模态”时,应用侧能更快将大模型能力落地为产品。对于正在评估模型选型的团队,建议重点关注MSA的推理成本测试数据,并与同等参数量的稠密模型做对比——在同等预算下,稀疏激活的M3可能带来更高的吞吐与更低的响应延迟。国产开源生态正在从“可用”走向“好用的规模化”,而M3是这条路上一个值得长期跟踪的锚点。