长期以来,形式化验证被视作软件工程的“圣杯”——用数学方法证明代码无误,而非依赖测试“发现”bug。然而,其高昂的计算成本和陡峭的学习曲线,使其长期囿于操作系统内核、加密库等极小范围的“精英领地”。Mistral AI刚刚发布的Leanstral 1.5,正在改写这一规则。
这款新模型并非简单的“更大的大模型”。Leanstral 1.5拥有1190亿参数,但推理时仅激活60亿参数,这是一种极为高效的MoE架构。更值得关注的是其成果:在miniF2F数学证明基准上达到100%的完美得分;在更具挑战的PutnamBench(美国大学生数学竞赛题集)中,成功解决了587道题(共672道)。但以上可能只是“开胃菜”。
真正引爆行业关注的,是它“主动找茬”的能力。Mistral AI宣称,Leanstral 1.5在被部署为“智能体”后,自动扫描了57个开源代码仓库,并成功发现了5个此前未被发现的真实逻辑缺陷(bug)。这不再是学术基准上的POC,而是实打实的基础设施级代码审计。
支撑这一表现的,是“联邦无监督协同优化”(Federated Unsupervised Collaborative Optimization, 简称CISPO)——一种强化学习训练框架。模型经历了中期训练、有监督微调(SFT)和基于CISPO的RL三阶段洗礼。这意味着它不仅学会了模仿专家,更通过“解题-反馈-修正”的闭环,习得了形式化验证的隐式思维链。
从行业视角看,Leanstral 1.5的推出具有转折意义:
- 成本杀手:其在miniF2F上的计算成本仅为同类前沿模型的1/75。这打破了“验证=烧钱”的刻板印象,让中小型团队也有机会在生产环境中启用形式化验证。
- 开源生态加速器:模型采用Apache-2.0许可,代码和权重已在HuggingFace公开。开发者可免费调用API,这意味着AI驱动的代码证明能力,正从论文中的“可行性研究”转化为每个Pull Request的“内置检查项”。
- 从“无错误”到“可验证”:对于金融交易系统、智能合约、自动驾驶等对正确性有“执念”的领域,Leanstral的实用化意味着:我们不再仅仅是相信代码没有bug,而是可以证明它没有bug。
结论与建议:形式化验证的“平民化”已不再是预言。对于技术负责人,现在是时候评估将此类工具集成至持续集成/持续部署(CI/CD)管线的可行性了。对于开发者,哪怕初次接触笛卡尔积和依赖类型,通过Leanstral驱动的AI助手,也能以自然语言描述核心逻辑,自动生成证明。在一个AI代码生成器日益普及、但代码质量把控愈发艰难的时代,Leanstral 1.5提供了一种全新的质量管理范式:让AI生成的代码,最终由AI来验算。