形式化验证(Formal Verification)长期被视为软件工程的“圣杯”——它能从数学上保证代码无误,但高昂的计算成本和缓慢的迭代速度使其难以落地。Mistral AI 最新发布的 Leanstral 1.5 正在改写这一局面:这款 Apache-2.0 许可的开源模型以 119B 总参数、仅 6B 活跃参数的稀疏架构,在 miniF2F 基准上达到 100% 饱和,而训练和推理成本仅为同类模型的 1/75。更关键的是,它已在 57 个真实开源仓库中自主发现了 5 个此前未被记录的 bug,证明 AI 形式验证已具备工程实用性。
Leanstral 1.5 的成功并非单纯依赖参数规模。其训练管线包含三个阶段:中间训练(mid-training)、监督微调(SFT)以及基于 CISPO(Contextual Iterative Self-Play Optimization) 的强化学习。CISPO 允许模型在证明过程中不断自我对弈,逐步优化策略,最终在 PutnamBench 上解决 587/672 道数学推理题,并在 FATE-H(87%)和 FATE-X(34%)两个高级形式化验证基准上刷新 SOTA。这种“智能体式证明”能力使得 Leanstral 1.5 能在复杂证明中自主搜索、回溯并生成完整断言链,而不仅仅是简单匹配模板。
对比现有的形式化验证方案(如基于 GPT-4 的专用微调模型或 DeepSeek-Prover),Leanstral 1.5 的关键突破在于 成本效率。传统做法通常需要数十亿参数的全激活模型,单次验证一个中等规模函数可能消耗数百美元计算资源。而稀疏激活架构使 Leanstral 1.5 在保持推理质量的同时,将单次验证成本压缩至 约 1/75,这为 CI/CD 流程中嵌入形式化验证扫清了经济障碍。Mistral AI 将其开源并用免费 API 提供,意图明显:推动社区形成“证明即测试”的新范式,让代码正确性从“可选优化”变为“默认要求”。
实际效果已在开源社区显现。Leanstral 1.5 扫描了 57 个流行的 Lean 数学库和算法仓库,自动识别出 5 个此前在人类审核中遗漏的 bug,包括一个安全性相关的边界条件错误。这种 “自动发现未知缺陷” 的能力,正是形式化验证从学术玩具转向工业工具的标志。对追求高可靠性代码的开发者(如金融、航天、嵌入式系统领域),Leanstral 1.5 提供了一个可免费嵌入验证流程的选项;对于开源维护者,它意味着“证明补丁”可能取代传统单元测试。
趋势上看,AI 形式验证正走向 “平民化”:极低的推理成本和宽松的开源许可将吸引更多第三方工具集成。不过,目前模型核心依赖 Lean 证明语言,生态扩张仍受限于社区规模。但考虑到 Lean 在数学和编程语言研究者中的渗透率,以及 Mistral AI 的推广力度,预计未来半年内会出现更多基于 Leanstral 1.5 的插件和 CI 工具。对于已尝试形式化验证但被成本劝退的团队,现在是再次入场的合适时机。