AI一小时破解五十年图论悬案:GPT-5.6 Sol Ultra引发数学信任危机

标题:AI一小时破解五十年图论悬案:GPT-5.6 Sol Ultra引发数学信任危机

摘要:OpenAI GPT-5.6 Sol Ultra在不到一小时内独立给出图论难题“循环双覆盖猜想”的完整证明。该猜想自1970年代提出后悬而未决超50年。模型未使用形式化验证工具,证明尚未经同行评审,若被证实将改写AI与数学家关系。

当一位数学家终其一生未能攻克的猜想,被一段代码在不足六十分钟内完整拆解,学术界必须面对一个尖锐的问题:我们是否准备好信任一个黑箱的结论?

OpenAI 旗下最新模型 GPT-5.6 Sol Ultra 在一场“数学挑战”中给出了惊人答卷:它针对图论中著名的“循环双覆盖猜想”——由数学家 George Szekeres 与 Paul Seymour 于 1970 年代提出,入选维基百科“未解决数学问题”列表逾 50 年——生成了完整的证明过程。模型通过调用 64 个并行子智能体及对抗智能体,在系统预留的 8 小时计算时间窗口内,仅用约 1 小时便完成了从假设到推理链条的全流程。OpenAI 已将该证明及其对应的提示词以 PDF 形式公开,供学界验证。

这一成果若经同行评议并通过,将是大型语言模型首次独立解决一个公认的公开数学难题,彻底打破以往 AI 仅作为“辅助验证工具”或“证据发现引擎”的定位。此前,DeepMind 的 AlphaTensor 和 FunSearch 均在特定约束下发现过新的矩阵乘法算法或组合优化策略,但往往结合大量人类设计规则。GPT-5.6 Sol Ultra 的模式则更接近“自主科研”:给定问题陈述后,模型自行拆解、搜索、反驳、重构,最终输出一个完整的逻辑闭环。

然而,数学界对这份未经审核的证明保持着审慎甚至怀疑的态度。缺少 Lean 等形式化验证工具的背书意味着该证明过程可能存在隐藏的推理缺陷——这类缺陷在大模型文本生成中并不罕见。更关键的是,模型以自然语言而非形式化语言输出,大大增加了人工审查的难度。一位知名图论学者在社交平台表示:“我们需要的不是‘看起来正确’的叙述,而是可重复、可细颗粒度检验的步骤。如果 OpenAI 想确立数学领域地位,应开放模型在形式化验证环境中的全部运行日志。”

对于科技媒体和从业者而言,这一事件的意义超越了单个猜想的解或未解。它标志着一个分水岭:AI 不再只是数学家的辅助工具,而正在成为“问题解决者”本身。若证明最终被确认有效,那么未来数学研究的组织形态将发生根本性改变——人类数学家或许需要重新定义自身的核心价值,从“证明构建者”转向“问题提出者与验证者”。反之,若证明被证伪,也将为 LLM 在严谨科学中的使用划出一条清晰的信任边界。

建议数学界与 AI 实验室加强协作,优先推进对这份证明的完整形式化翻译与逐行验证。同时,任何声称 AI 独立完成重大数学突破都应附带完整的可审计追踪。面对即将可能到来的“AI 数学时代”,我们需要的不是狂欢,而是严谨的判据。