119B参数仅6B活跃,Mistral开源形式化验证新突破:成本降至1/75,自动发现5个真实bug

形式化验证(Formal Verification)正从数学定理的象牙塔走向软件工程的核心战场。在DeepSeek-Prover、AlphaProof等模型轮番刷新基准后,Mistral AI悄然交出一份更具工程意义的答卷——Leanstral 1.5,一款以Apache-2.0协议完全开源的119B稀疏专家模型(仅6B活跃参数),将miniF2F基准推向100%饱和,并在开源代码仓库中自主发现了5个从未被报告的bug。

Leanstral 1.5最引人注目的不是参数规模,而是其“效率暴力”:总参数119B但推理时仅激活6B,训练成本仅为同类模型的1/75,却在PutnamBench上完成了587/672道题目(87.4%),并在FATE-H(87%)和FATE-X(34%)两个更困难的数学形式化基准上创下新SOTA。这意味着,当下最高效的证明助手模型不再需要巨额算力——Leanstral 1.5可以在消费级GPU上运行,并通过HuggingFace和免费API直接调用。

模型的训练路径揭示了Mistral对“证明智能体”的深层理解:持续预训练→监督微调→基于CISPO的强化学习。CISPO(Curriculum Implicit Stepwise Policy Optimization)是一套渐进式策略优化算法:先让模型在简单证明步骤上建立正确性直觉,再通过隐式奖励机制逐步挑战复合命题。这与DeepSeek-Prover使用的人格化奖励不同,CISPO更强调“证明步骤的隐含正确性自监督”,从而在推理时表现出更强的自纠错能力——在智能体式证明测试中,Leanstral 1.5无需人工干预即可独立完成连续5步以上的推理路径。

更具落地价值的是其“缺陷猎手”能力:在57个主流开源仓库(含Lean 4标准库、Python数值库、go-ethereum等)的证明文件检查中,Leanstral 1.5发现了5个此前未被人类开发者注意的潜在bug,包括一个可能导致整数溢出的遗漏边界检查和一个类型别名错误。虽然这些bug尚未造成实际事故,但证明了AI形式化验证已从“定理证明玩具”进化到“生产漏洞探测器”——对代码正确性有执念的开发者,现在可以将Leanstral 1.5集成到CI流水线中,自动检查关键模块的定理证明完整性。

值得注意的是,Leanstral 1.5依然存在明显边界:在FATE-X(包含非平凡数学猜想)上仅34%的准确率表明,它仍无法处理需要深层哲学直觉或跨领域知识的证明。但考虑到其成本仅为同规模模型的1/75,且完全开源可二次训练,未来版本很可能通过社区贡献的证明数据快速迭代。

对于技术决策者,Leanstral 1.5的发布释放了一个明确信号:形式化验证的“AI助手”已从奢侈配置变为可负担的基础设施。如果你正在开发金融系统、智能合约或航天软件等高可靠性应用,现在正是将Lean 4定理证明器与Idealistic证明模型(如Leanstral 1.5)组合进开发工具链的最佳时机——无需等待,因为开源权重和API已在线。