AI批量攻克开放数学题?推文声称突破但缺论文验证需谨慎

一则来自哥伦比亚大学计算机科学家Omri Weinstein的推文引发AI数学研究社区震荡:他声称OpenAI的模型在Erdős相关开放数学问题上取得突破,甚至改变了此前“LLM无法从事通用数学研究”的信念。然而,该消息仅以个人声明形式出现,未见任何论文预印本、技术报告或开源代码。这究竟是AI数学能力的质变信号,还是一场缺乏实证的乐观宣言?

素材中提到的“Erdős突破”指向著名的匈牙利数学家Paul Erdős。在离散数学、组合学等领域,许多未解难题被称为“Erdős问题”,其解决者往往能获得Erdős数的荣誉。能够用AI系统批量解决这类问题,意味着模型首次在真正开放、非标准化的数学推理任务中展现出可重复的能力——这与过去AI在数论定理证明(如Lean、Coq辅助证明)或封闭式数学竞赛(如AMC、MATH数据集)中的表现有本质区别。后者通常依赖已知公理或有限状态搜索,而Erdős问题往往没有明确的形式化路径,需要创造性构造。

值得对比的是,2024年DeepMind的AlphaProof在IMO试题上取得银牌水平,但那仍是标准化问题的求解;OpenAI的o1模型在数学推理基准上也有显著提升,但均未触及“真实科研级”未解难题。若此次声明属实,将是AI首次在“发现新定理”而非“复现已知解法”上取得实质性突破,其意义堪比2016年AlphaGo战胜李世石——但从围棋到数学,通用推理的难度差异巨大。

然而,数学界的核心规范在于“可验证性”。任何重大突破都需经过同行评审、代码复现或至少公开发布完整的推理链条。Weinstein的推文仅是一句话的感叹,缺乏实验细节、模型名称、问题具体列表以及成功率统计。事实上,此前已有多次AI攻克数学难题的“虚惊”:比如2024年有预印本声称GNN解决了“极大图染色猜想”,后被指出存在逻辑漏洞。当前OpenAI并未就此事发布任何官方声明,其内部研究团队也未通过论文预印本平台(arXiv)披露信息。

从技术角度看,LLM解决开放数学问题可能依赖“记忆”而非“推理”——训练数据中如果包含类似问题的讨论或部分解法,模型可能通过模式匹配生成看似合理的答案。真正的数学突破需要严格证明,而LLM目前最受诟病的正是“幻觉”倾向和不一致的逻辑链条。因此,在没有低层代码、证明脚本或至少人工验证报告前,保持审慎是理性的选择。

对AI行业而言,这则消息再次强调了“信任但验证”的原则。投资者和研究者应关注后续是否有独立团队复现结果,同时警惕过度炒作。对数学界而言,若此事属实,将开启AI辅助数学研究的全新范式;若为假,则只会消耗社区信任。建议有兴趣的读者密切跟踪arXiv或OpenAI官方博客,在实质证据出现前,不宜将推文当作科学结论。