AI首次批量攻克开放数学难题?谨慎乐观中暗藏突破信号

一条来自哥伦比亚大学计算机科学家Omri Weinstein的推文正引发数学界与AI圈的震荡:“即便是@OpenAI近期的Erdős突破,也未让我相信LLM能从事一般数学研究。但这次,我改变了想法。”这条推文背后,暗示着一项尚待验证的成果:AI首次批量解决了实质性的开放数学问题,而非仅仅做习题或补全公式。

所谓Erdős问题,源自20世纪最伟大数学家之一Paul Erdős生前悬赏求解的系列难题,涵盖数论、组合学等多个分支。这些题目因其简洁陈述与深奥解法,被视为测试AI数学推理能力的“终极考场”。过往的AI解题尝试,无论是Google的Minerva还是OpenAI的GPT-4,都只能在已知证明或模拟竞赛题中表现优异,面对真正未解的开放性问题却近乎“失语”。

若Weinstein的印证属实——尽管他仅发布推文而非论文或代码——这一进展意味着LLM已跨越“模式匹配”阶段,进入“生成性推理”新范式。事实上,AI在数学上的能力边界早已引发两派论战:乐观者引用2023年AlphaGeometry在奥林匹克几何题上的亮眼成绩,认为大模型蕴含“类人直觉”;怀疑者则指出,当前所有数学AI本质上仍是符号操作与概率预测的组合,缺乏真正的洞见。

此次事件的关键信号不在于“AI会解数学题”,而在于“AI解决了人类尚未解决的问题”。如果后续能公开可验证的证明逻辑,将直接动摇“LLM无法产生新知识”这一核心批评。但行业必须警惕推文文化催生的信息泡沫——历史上有过多次被高估的“AI突破”(如2022年声称的“AI发现新物理公式”最终被证实为统计过拟合)。在arXiv预印本或GitHub代码库出现前,所有宣称都只能作为方向性的灵感,而非可复用的成果。

对于AI从业者与数学研究者,此刻最佳策略是:既不盲从兴奋,也不轻率否定。可尝试用同样问题集对比测试其他模型(如Claude、Grok),观察是否存在泛化能力;同时关注目标数学期刊或会议(如ANNALS OF MATHEMATICS)是否有收录迹象。若消息属实,它将改写AI研究的评估标准——从“解题正确率”转向“问题发现与解决能力”。但在此之前,请把推文当成创意火花,而非学术证据。