100%饱和miniF2F,成本仅1/75:Mistral开源形式化验证模型Leanstral 1.5

形式化验证长期被视为软件正确性保障的“圣杯”,却因其高度专业性和高昂计算代价而未能融入主流开发流程。Mistral AI近期发布的Leanstral 1.5正试图打破这一僵局。这款基于Apache-2.0许可证完全开源的模型,以119B总参数、仅6B活跃参数的MoE架构,在多个关键基准上达到饱和或最优水平,且训练成本仅为同类模型的1/75——这既是技术突破,也是成本民主化的信号。

从性能看,Leanstral 1.5在miniF2F基准上取得100%饱和,意味着它能够正确解决全部测试用例。在更具挑战性的PutnamBench(一场面向大学生的高级数学竞赛试题集)中,它解决了672道题中的587道,占比约87.3%。更为关键的是,它在两个形式化验证领域的综合基准FATE上创造了新纪录:FATE-H(人工标注)达到87%,FATE-X(自动提取)达到34%。这些数字背后,是通过多阶段训练——从预训练中期持续训练(mid-training)、监督微调(SFT)到基于CISPO(一种上下文信念状态策略优化)的强化学习——所积累的推理能力。

Leanstral 1.5的真正价值在于智能体式证明能力:它可以自动探索证明路径,调用策略,甚至发现代码中的隐藏缺陷。在部署测试中,模型扫描了57个开源仓库(涵盖数学库、定理证明器、验证框架等),共检测出5个此前未知的真实bug。这些bug并非语法错误,而是逻辑漏洞或边界条件缺失,传统静态分析工具往往无法捕获。这一结果直接印证了AI形式验证从实验室走向实用化的可能。

对比此前业界领先的方案(如基于GPT-4或专有后训练的开源模型),Leanstral 1.5的训练成本仅为1/75,这意味着更低的部署门槛和更轻量的硬件需求。对于追求代码正确性的开发者,尤其从事高可靠性系统(航空航天、密码学、区块链、金融交易引擎)的工程师而言,这款模型提供了可脚本化的、开箱即用的证明助手。它并非要取代专业的形式化验证工程师,而是将“发现并修复逻辑错误”的能力下放给更广泛的代码创作者。

展望未来,形式化验证与AI的结合正在经历从“人写机器检查”到“AI辅助证明生成”的范式迁移。Leanstral 1.5的Apache-2.0许可进一步降低了社区贡献与二次开发的门槛。建议开发者通过HuggingFace或Mistral提供的免费API试用该模型,尤其关注其在持续集成流水线中作为自动化证明检查的潜力。当证明成本降至可忽略不计,代码正确性将从“最佳实践”升级为“默认行为”。