大模型在代码领域的竞争已从“会写代码”进入“会审代码”的深水区。一项来自第三方评测机构的代码审计对比实验,将两款模型——Claude Opus 4.8与MiniMax M3——置于完全相同的条件下:同一代码库、同一提示词、17个已知植入的缺陷。结果显示,两者在缺陷检出准确率上打成平手。
更值得关注的是成本坐标系的翻转。MiniMax M3的推理成本仅为Claude Opus 4.8的近1/50。以单次代码审计任务为例,使用Claude Opus 4.8的API开销可能高达数十美元,而M3的对应成本不足一美元。对于需要大规模持续审计的企业团队,这种差距将直接决定方案的盈亏线。
代码审计是软件开发安全中最依赖专家经验、也最耗时耗力的环节之一。传统做法依赖人工逐行审查,成本高、周期长。大模型的介入有望将审计变为自动化流水线,但前提是模型必须在准确率与成本之间找到平衡。此前,业界普遍接受“高准确率必然对应高成本”的默认选项——Claude Opus 4.8正是这种思路的代表。MiniMax M3的评测结果则给出了另一种可能性:用更低的算力开销实现同等水平的缺陷发现能力。
这并非简单的“降维打击”,而是技术路线差异的体现。MiniMax M3采用了混合专家架构(MoE)和更高效的注意力机制,使其在保持精度的同时大幅压缩了计算需求。另一层背景是,国内大模型厂商正从“参数竞赛”转向“落地性价比”竞争,MiniMax的这次公开评测可视为一次关键的交卷。
对于技术选型团队,建议关注以下两点:第一,当前评测仅聚焦于代码审计这一具体任务,准确率打平不意味着在通用编码或复杂逻辑推理上全面对标,需要根据自身场景做补充验证。第二,成本优势明显,但部署方式、延迟、频控等因素同样影响实际使用体验,建议进行小规模灰度测试。如果团队正面临预算压力或大规模代码审计需求,MiniMax M3已具备成为主力模型的潜力。