OpenAI GPT-5.6 Sol Ultra 一小时攻破五十年图论悬案

OpenAI 于官方渠道宣布,其新一代大语言模型 GPT-5.6 Sol Ultra 在短短 57 分钟内生成了图论领域著名难题“循环双覆盖猜想”(Cycle Double Cover Conjecture)的完整证明。该猜想由数学家 George Szekeres 与 Paul Seymour 于 1970 年代提出,属于维基百科“未解决数学问题”列表中悬而未决超过 50 年的老牌难题。如果这份证明通过后续同行评审,这将是大型语言模型(LLM)首次独立攻克公开数学猜想,标志着 AI 在符号推理与创造型数学证明领域进入全新阶段。

根据 OpenAI 披露的技术细节,GPT-5.6 Sol Ultra 并未采用传统的“单模型单次推理”方式,而是内部启动了 64 个并行子智能体(sub-agents),每个智能体负责探索不同的证明路径。同时模型部署了专门的对抗智能体,负责寻找证明中的漏洞并施加压力,迫使子智能体不断修正论据。整个计算过程预留了 8 小时的计算时间,而模型在约 1 小时内便输出了一份结构完整的证明文档。OpenAI 已将该证明及其对应的提示词(prompt)以 PDF 形式公开发布,供学界检验。

与以往 AI 辅助数学证明案例(如 DeepMind 的 AlphaZero 在纽结理论中的突破,或早期 GPT 系列被用于验证已知定理)不同,本次 GPT-5.6 Sol Ultra 的工作流程更接近“独立研究者”:它从未被显式教导图论知识,也未使用 Lean 等形式化验证工具做事后检查。这意味着证明的逻辑链条目前仅靠自然语言承载,数学界对此保持高度审慎。多位图论学者在社交媒体上表示,该证明尚未经过同行评审,且缺乏形式化编码的不可逆验证,其正确性存疑。循环双覆盖猜想属于组合数学中结构极深的问题,历史上多次有人声称证明却被发现漏洞。

若该证明最终被数学共同体接受,则意味着 LLM 已经具备从零开始构思并完成长链条、多分支推理的能力——这不仅会重塑数学界对“机器证明”的信任,更可能彻底改变数学研究的方式:从辅助验证走向独立发现。值得对比的是,此前 AI 在数学领域的最强表现是 OpenAI 的 minerva 解答奥数竞赛题,以及 DeepMind 的 AlphaGeometry 在几何问题上的突破,但那些模型仍受限于既定问题库或符号规则。GPT-5.6 Sol Ultra 则面对一个公开悬而未决的难题,且未经过图论专项微调。

对于中文科技读者,这一事件的实际参考价值在于:大模型在多智能体协作与对抗自纠错机制上的进化速度,远超多数人的预期。尽管当前仍需警惕“未经形式化验证的 AI 证明”可能隐含的幻觉,但将 64 个子智能体并行工作、搭配对抗智能体进行压力测试的架构,本身已为复杂推理任务提供了新的工程范式。建议 AI 从业者关注 OpenAI 发布的提示词 PDF,尤其是其中引导模型进行“分治-对抗-归约”链条的指令设计——这可能成为下一代推理模型的标配能力。