尧图精选

GPT-5.2 Pro独立证明45年数论猜想,形式化验证重塑数学研究

🕒 发布时间:2026/9/17 4:29:41 📁 来源:尧图网络
GPT-5.2 Pro把一道悬置了45年的数论猜想独立证明出来了据说陶哲轩看过之后给的评价是“没犯任何错误”。这条消息这两天在我的朋友圈里刷了屏数学圈和AI圈都像过年一样。但作为两边都沾过的老油条我第一反应不是“AI好强”而是“这事的验证流程到底走通了没有”。过去我们见过太多AI在数学上的“高光时刻”做对几道奥数题、猜出一个新不等式、帮人类把某个计算量爆炸的搜索跑完。这些都很酷但本质上还是在人类划定的轨道里跑。可这次不一样消息里的关键词是“独立完成证明”。我理解的意思是AI不仅提出了证明思路还把每一步推导完整写了出来并且通过了可复现的检验。如果属实这可能是我们第一次看到AI在一个困扰人类数十年的开放问题上走完了从“猜想”到“定理”的全流程。当然我不建议任何人现在就冲出去喊“数学家要失业了”。我更想认真拆解的是这条消息如果真的落地背后需要满足哪些条件、经过哪些关卡、还有哪些坑。这篇文章我不会只讲“AI好厉害”而是站在一个常年跟数学证明打交道的从业者角度把这件事掰开揉碎聊清楚。1. 先别急着欢呼这事儿到底在说什么1.1 “独立完成证明”和“没犯任何错误”的分量先说“独立完成证明”。在数学界一个证明要算数它必须是从公理出发经过严格逻辑推导最终得到目标命题的完整链条。以前AI干的是“半截活”搜一个例、给一个反例、算一个数值结果这些只能当辅助线索不能当定理。而“独立完成证明”意味着AI拿到了一个开放问题自己设定了证明策略自己构造了中间引理自己完成了所有推导步骤最后产出了人类可读且机器可验证的完整证明。再说“没犯任何错误”。这句话在数学语境里其实很重。它不是“算得没错”这么简单而是包括逻辑无漏洞、边界条件全覆盖、特殊情况全部处理干净、每一步都站得住。尤其是数论问题经常会有一些极其刁钻的反例藏在无穷远处一个看似完美的归纳论证可能因为某一个极小下标的基础情况没验证到就直接崩盘。所以“没犯错误”不是一句轻飘飘的评语它几乎等于在说整个证明经得起反复审查。我更关心的是这个“审查”。陶哲轩是谁大家都清楚菲尔兹奖得主、当代数学界公认的顶尖大脑。他对一个AI产出的证明给出这样的评价至少说明这则消息不是随便一个营销号传出来的。但从严谨角度说我依然会强调这是“消息称”不是“陶哲轩本人的公开发言记录”。我们后续需要看到完整证明全文和形式化验证文件才算真正的闭环。1.2 为什么这条消息让我觉得“风向变了”以前AI做数学给我的感觉是“做题机器”。你可以让它解代数方程、做积分、找反例但它的产出是零散的对数学共同体的价值有限。数学最硬核的部分永远是“证明一个从未被证明过的命题”这要求系统理解整个证明的结构、掌握无穷多情形下的统一处理办法、并在适当的地方引入新的数学对象。这次如果GPT-5.2 Pro真的独立完成了一个45年悬而未决的数论猜想说明它已经不只是“会做题”而是“会做研究”了。我做数学相关项目多年很清楚这两者之间的鸿沟有多大。做题是把已知方法套到已知模式上而证明新猜想往往需要发明新工具、设计新路径甚至在某些节点选择“绕路”而不是“硬闯”。消息里没有公布这个猜想的细节但数论猜想有一个共性是陈述通常极其简洁比如“某类数有某种性质”但证明往往要穿越大量复杂的技术细节。AI能把这样一个问题从头到尾走完说明它在长程推理、结构规划、异常情况取证这些方面都达到了相当高的水平。这正是让我觉得风向变了的原因。2. AI从“计算器”到“证明者”底层逻辑发生了什么变化2.1 过去十年AI在数学里到底干了什么要理解这次事件的含金量先得看看过去几年AI在数学里的真实位置。最常见的是符号计算工具比如Mathematica、SymPy这类。它们能做因式分解、求极限、解微分方程但本质上是按照人类预先写好的算法执行运算属于“高级计算器”。它们产出结果但不产出理解也不产出新的数学结构。然后是机器学习模型在数学发现中的应用。有一阵子很多人用神经网络去猜公式、找规律。比如给模型一堆整数序列让它预测下一项再根据规律去反推可能存在的公式。这类工作确实催生过一些有价值的猜想但得到的结果基本停留在“建议”层面人类数学家拿到提示后还得自己想办法证明。到了2024年前后推理增强的大模型开始在数学竞赛题上发力。DeepMind的AlphaProof在IMO赛场上拿过银牌OpenAI的o系列模型在AMIE这类测试里也有不错表现。但这些都是“有限时间内的解题”题目的答案一般是已知的模型要做的更多是“找到一条可行路径”。很少有人尝试让AI直接去啃一个无数人攻了多年的开放猜想因为那需要的不只是解题技巧更是对数学结构本身的深刻理解。这次GPT-5.2 Pro如果真如消息所说独立完成了45年猜想它实际上跨越了三个台阶从“按规则计算”到“按策略推理”从“短程解题”到“长程证明”从“输出结果”到“输出可验证的完整逻辑链”。这才是真正的质变。2.2 三条腿走路语言模型、符号引擎与形式化验证坦率地说我不认为现在的语言模型能单靠“背知识”就证明出新的数论定理。数学证明和写文章不同每个推导步骤都必须严格合法语言模型很容易生成“看起来合理但实际有漏洞”的内容。所以要支撑起“独立完成证明”大概率是三条技术路线合流第一条是语言模型负责策略规划。它负责理解命题、提出整体证明思路、生成中间引理的候选方案。这一步可以很粗糙但必须方向对。第二条是符号计算引擎负责具体推导。一旦中证明了“关键步等价于某个整数不等式的验证”后续就应该由符号引擎去做精确计算而不是让语言模型去“猜答案”。第三条是形式化证明助手负责全链条把关。比如Lean、Coq这类系统会把证明拆解成极其细小的逻辑步骤每一步都用机器可检查的规则去判断是否成立。只要最后整个证明文件在验证器里跑通了从结构上就杜绝了“这里跳了一步”的漏洞。这三条腿缺一不可。没有语言模型系统很难提出创新的证明策略没有符号引擎复杂的计算没法落地没有形式化验证没人敢说“没犯任何错误”。我猜“没犯错误”这句话能在消息里出现多半就是因为证明最终通过了机器验证而不只是“我们人工看了看感觉没问题”。2.3 数论为什么会被选中当试验场数论在数学分支里是一个非常合适AI去“啃硬骨头”的领域原因有三。第一数论命题的陈述极度简洁。比如“存在无穷多个素数满足某种性质”一句话就能说清问题不需要像几何那样先建三维模型也不像代数几何那样需要一大堆抽象概念铺垫。对AI来说问题本身好理解难度集中在证明环节。第二数论里存在大量“条件很容易验证、但证明极难”的猜想。这类问题很适合形式化验证因为命题本身可以翻译成一组有限的整数关系式。AI可以非常具体地去检查每一个边界条件而不是在抽象空间里瞎转。第三数论有很多供AI学习的现成知识库。几百年来的数论成果已经被整理成系统化的理论和可检索的文献训练语料相对丰富。AI可以从已有的定理库中提取工具再组合成新的证明路径。这也是为什么数论会成为AI证明的第一个热门试验场。我不是说数论简单相反数论里很多问题人类想了几十年也毫无头绪。但AI这次选择的方向确实很聪明找一个陈述简单、验证困难、但路径搜索空间相对明确的问题。这是进攻开放问题的最佳突破口。3. 复盘式拆解一个45年数论猜想是怎样被AI“走完”的3.1 第一步把自然语言的猜想翻译成机器可验证的命题任何数学证明如果要求“没犯任何错误”第一件事就是消灭歧义。人类看一个数论猜想可能因为“整除”“素数”“下界”这些词的日常含义产生模糊理解但机器不允许任何模糊。所以这一步要把自然语言描述的猜想转换成形式语言。以Lean为例目标大致会长成这样-- 示意代码不代表猜想的真实内容 example (n : ℕ) (hn : n ≥ 1) : ∃ p : ℕ, Nat.Prime p ∧ p ∣ some_expression n : by -- 这里是证明当然真正的数论猜想会比这个复杂得多可能涉及指数、同余、渐近估计等多种结构。但这个转换过程本身就是一次“严格化”AI必须把问题的每一个限定条件都写清楚确认“我们到底在证明什么”。这里有个容易被忽略的坑形式化翻译本身也可能出错。如果AI把猜想的某个条件翻译错了后面所有证明都是空中楼阁。所以靠谱的做法是在AI完成翻译后人类数学家还要仔细对照原始陈述检查一遍确认形式化版本和自然语言版本确实等价。我看到的不少AI数学失败案例最后翻车都不是倒在证明的后半段而是倒在第一步翻译上。很多模型对自然语言理解得不错但对数学里的严格约束条件敏感度不够。如果这次GPT-5.2 Pro真的是“零错误”至少说明它在形式化翻译这一步已经做到了滴水不漏。3.2 第二步生成证明策略与搜索路径命题翻译好了接下来的问题是怎么证明这一步完全是AI的主场。传统数学家拿到一个猜想脑子里会飞速检索“以前有没有类似的结论”“这里能不能用已知定理”“如果直接证明不行要不要试反证法”。AI做的是类似的事情但它的检索速度更快、搜索空间更广而且可以不按人类的思维定式来出牌。对于数论证明常见的策略包括无穷递降法假设最小反例存在再构造一个更小的反例从而推出矛盾。归纳法证明当命题对n成立时对n1也成立再补充基础情形。反证法加解析估计假设命题不成立推导出某个量被同时上下界限制最终产生矛盾。构造性方法直接给出满足条件的显式构造再证明构造满足所有约束。AI可能不会只挑一种方法死磕它大概率会同时探索多条候选路径。语言模型负责给出“这一步可能有戏”的直觉判断符号引擎负责把每个候选路径简化到可计算的状态。如果某条路径进行到一半卡住系统再回头换另一条。这一步的关键是“如何剪枝”。搜索空间是指数级的AI必须依靠内部的启发式判断把精力集中到最可能成功的路径上。消息里如果只说“GPT-5.2 Pro完成了证明”我猜它背后实际经历过的失败尝试可能数不胜数只是最终产出了没有错误的那一条。3.3 第三步形式化验证——所有人类能耍赖的地方都被堵死这是整个流程中最硬核的一步。人类写证明经常会说“显然可得”“不难推出”但这些词在机器面前是不被接受的。证明助手要求你把每一步拆到无法再拆为止所有隐藏假设都必须显式写出来。一次形式化验证的过程大致像是你把一个证明目标拆成若干子目标对每个子目标调用某个已知定理或计算规则然后系统会检查你的调用是否合法。如果某个步骤使用了不成立的假设验证器会直接拒绝。如果两个量明明相等但你没有显式说明原因验证器也会拒绝。所以在Lean或者Coq里完成一个大型证明人类数学家前期经常会被折磨到怀疑人生。一个小小的“把等式两边同时乘以某数”都需要给出理由。AI如果能在这种严苛环境下把证明写完意味着它产出的证明从技术细节上已经无懈可击。我见过一些人对形式化验证有误解觉得“验证器本身也是代码也可能有bug那验证不是也没用”。这话有一定道理但关键是形式化验证把一个“可能出错的推理过程”变成“一个极小范围内可能出错的代码执行”。人类证明的漏洞可能藏在几千页的思维跳跃里而形式化验证的漏洞只可能藏在一两万行验证器代码里。后者的错误概率要低得多。3.4 第四步人类的最后审阅陶哲轩在看什么即使机器验证通过了数学共同体依然需要人类专家的审阅。原因很简单机器验证证明的是“证明在给定的定义和公理下成立”但人类还要确认“这个定义真的是我们想讨论的那个数学对象”“这些公理选择是否自然”“证明本身是否提供了真正的洞见”。一个复杂的证明就算每一步都正确也可能只是“硬凑出来”的组合无法给人类数学家带来新的理解。陶哲轩这类顶尖数学家在看AI证明时通常会关注几个层面第一核心创新点在哪里证明中是否有让人眼前一亮的新想法还是仅仅把已知技术做了复杂组合。第二是否过度依赖计算有些证明把大量情形丢给计算机暴力搜索虽然合法但数学价值会打折扣。人类往往希望看到一个统一的理论解释而不是一个厚重的查表过程。第三边界条件是否处理干净。数论里的“特殊情形”常常是最容易出bug的。陶哲轩能给出“没犯任何错误”这个评价说明他应该已经重点检查过这些容易翻车的地方确认AI没有蒙混过关。4. 真正被改变的可能是数学界的“生产关系”4.1 哪些数学分支会最先被AI证明攻陷我判断接下来的3到5年以下几个方向是最容易被AI证明攻占的高地。组合数学是最典型的“AI友好区”。组合问题通常离散、结构清晰、可以用有限步骤搜索验证。很多组合等式证明起来冗长、机械但对AI来说是舒适区。图论里的染色问题、极值问题也属于这一类。数论中的解析数论和初等数论也会受益。特别是有明确解析估计、或者可以转化成有限区间验证的猜想AI可以辅助完成大量繁琐的边界处理。这次45年猜想如果真解决了很可能就是在这一类里。偏序集、格论、有限群论等代数结构里的机械化验证也很适合AI。这些领域已经有大量成熟的定理库AI可以直接在已有库的基础上进行扩展而不需要从零开始。与之相对的偏微分方程、几何分析、代数几何这类需要高度抽象构造和几何直觉的分支短期内AI很难真正攻陷。因为这些领域的关键步骤往往依赖“看到一个巧妙变换”而这种几何直觉目前最难被形式化。4.2 哪些东西AI暂时碰不了虽然AI这次表现亮眼但我必须泼一盆冷水数学研究中大量的“软技能”AI目前学不会。第一提出好问题的能力。数学研究的真正起点不是证明而是判断“哪个问题值得去证”。一个有价值的问题需要生态、需要直觉、需要对整个数学版图的把握。AI目前还没有自己的研究品味它只会去证你给它的命题。第二建立新概念的品味。很多伟大的数学工作不是因为证了一个老猜想而是发明了一种新语言、新框架让以前模糊的东西变得清晰。AI可以组合已有概念但很难凭空创造一个有生命力的抽象结构。第三跨领域迁移。真正顶尖的人类数学家能以出其不意的方式把一个领域的技术搬到另一个领域。这种跨域迁移依赖于深层的类比能力而AI目前更多是在同一个领域内部搜索。所以我的判断是AI正在变成数学家手里的强大利器但短期内还不可能替代数学家。它更像一个“不知疲倦的超级博士后”你给它方向它能大规模搜索、计算、验证但决定方向的依然得是人。4.3 数学家的角色开始从“作者”变成“审稿人/策展人”如果AI能独立完成越来越多证明数学界的生产关系一定会变。传统上数学家的工作流程是“自己产生想法、自己写证明、自己投稿”。未来很可能变成“AI生成多个候选证明、人类数学家筛选最有希望的路线、交给AI完善细节、人类最后负责审阅和推广”。这意味着数学家的核心能力会从“证明细节”转向“方向判断”和“价值判断”。你不需要亲自完成每个冗长计算的细节但你必须能够判断哪条证明路线值得继续投钱、哪个证明背后藏着一个真正的数学洞见、哪个结果配得上发在最好的期刊上。这也对年轻数学家的培养方式提出了挑战。现在的数学教育还是让学生刷题、写完整证明未来可能更要训练学生“如何指挥AI去做证明”以及“如何评价一个AI产出的证明到底好不好”。这种转变可能比AI本身更值得关注。5. 别急着把“零错误”当免死金牌5.1 形式化验证并不能保证公理体系本身没有问题这句话可能让很多人意外即使AI的证明在Lean里完整通过了也不能100%保证命题在数学意义上成立。因为证明是基于公理体系的而公理体系本身可能相互矛盾或者不够充分。最经典的例子是选择公理。有些定理在承认选择公理时成立在不承认选择公理时不成立。你说这个定理对不对得看你在哪个公理体系下谈。形式化验证只能证明“在选定的公理系统内成立”不能证明“在所有的数学框架下成立”。当然对于大多数数论问题使用的公理体系是相对稳定的这个风险不大。但“零错误”在严格意义上应该表述为“零逻辑错误在已选定的公理系统内”。媒体传播时往往会把这种严谨表述简化成一句略带神话色彩的“没犯任何错误”。5.2 “零错误”在统计学上几乎是个可疑信号这一点是我做项目审稿时的直觉。一个大型证明如果完全没有任何错误确实很完美但在统计学上并不常见。数学家在写证明时即使是菲尔兹奖得主也经常在第一版里留下笔误、漏条件、甚至逻辑断点。如果一个复杂的证明真的“零错误”只有两种可能要么AI在产出过程中就已经通过内部机制把错误全部过滤掉了要么证明本身被压缩得足够抽象还没有展开到足够多的细节。如果是前者那是真本事如果是后者那问题就大了——看起来没错误只是因为你没有把每个细节都抠出来。所以我希望后续能看到两样东西一是完整的证明全文二是对应的形式化验证文件。前者是给人看的后者是给机器验的。如果有人只给我们看一张截图或者一段摘要我建议保持怀疑。5.3 数据污染AI是否“背过答案”这是我在AI数学问题上最担心的一件事。如果GPT-5.2 Pro在训练语料中已经“见过”这个数论猜想的证明思路那它的“独立完成”就名不副实了。类似的事情在AI界发生过很多次模型在基准测试里分数虚高最后发现是因为训练数据里混入了测试集。数学领域相对有个优势真正未解决的猜想证明很少出现在公开语料里因为它还没被解出来。但也要警惕一种可能这个猜想的证明思路散落在不同文献中AI只是把它组合出来了。这种情况在我看来依然很牛因为组合本身也是创新但严格意义上就不能说“独立完成”了。我更希望看到的是这个猜想的证明用到了类似的技术但这个技术组合在以往文献里从未出现过。如果能确认这一点“独立完成”这四个字的含金量才算真正落地。5.4 数学共同体的信任机制才是最后一道防线说到底数学共同体对一个证明的信任不只看机器验证还要看数学家之间的相互审阅和复现。一个定理被写出来发表出来至少要经过几关同事预印本讨论、期刊同行评审、后续研究者引用和扩展。如果后续研究者基于这个定理去推动其他研究时发现有问题它会被推翻。AI证明也不例外。即使这次GPT-5.2 Pro真的“零错误”完成了证明我也期待看到它被放进更大的研究生态里被后续论文反复引用和检验。数学是一个高度自纠错的知识体系单一消息不足以建立长久信任但每一次成功的复现和扩展都会让信任加深。6. 普通数学研究者现在能做什么6.1 先学一个证明助手Lean是当前性价比最高的选择别急着研究怎么让AI替你证明先把地基打好。我的建议是花一个月时间入门一个证明助手。首选Lean理由有三社区活跃、数学库Mathlib非常庞大、教程质量高。Lean的入门路径我已经帮不少人走过最顺的流程是安装Lean和VS Code插件跑通第一个example。做“Natural Number Game”的在线教程这个游戏式教程能帮你快速理解证明助手的思维方式。通读《Mathematics in Lean》的前几章把自然数、集合、函数的基本操作学会。从Mathlib里找一个简单定理尝试自己独立证明出来。这个过程很磨人尤其是前两周你会发现“连一加一等于二都要写好几个步骤”。但一旦适应了这种极致的严格性再回头看AI做的证明你就能真正看懂它到底厉害在什么地方也能在验证时发现它可能藏的问题。6.2 建立一套“AI生成形式化验证人工审阅”的日常工作流如果你已经具备基础证明能力日常做研究时可以这样用AI先用语言模型作为“想法生成器”让它针对手里的问题提出若干证明思路。不要听它说“我觉得可以这样证明”就信而是把候选思路当成线索。然后把最有希望的线索拆解成若干子目标试着在Lean里形式化。先别急着证明完整个问题可以从最关键的引理开始。如果某个子目标能被形式化验证通过说明这个方向的可靠性显著提升。最后再人工审阅一遍形式化证明的结构看它是不是符合你的直觉有没有“机器能验证但人无法理解”的部分。如果机器验证能通过但人类完全看不懂它在做什么这个证明即使正确数学价值也可能有限。这个工作流看起来比直接“让AI算然后抄答案”慢但它把你的研究变成了一个知识积累的过程。你每多形式化一个引理你的定理库里就多一件可复用的工具下次遇到类似问题时会越来越顺。6.3 投稿与审稿的新规矩请附上可复现的证明文件我特别想呼吁数学界和期刊界重视一件事以后涉及复杂机器辅助证明的投稿应该要求作者附上完整的可复现证明文件。现在的期刊审稿靠的是两三个同行硬着头皮把证明读一遍。如果证明是AI生成的、几百页长、还夹杂着大量机器可检查但人很难读的步骤传统审稿机制会直接失灵。唯一的出路就是投稿时把Lean或Coq的验证文件一起交上去编辑部可以运行验证器来确认技术层面的正确性。我知道这样的改变很难涉及审稿制度、工具链、期刊编辑的技能储备但从这次45年数论猜想的事件来看这件事已经不能再拖了。数学的未来一定是“人类给出品味与方向机器保障严谨与细节”而投稿制度得先跟上这个变化。结尾我更关心的事说实话看到“GPT-5.2 Pro独立完成证明”这个消息我心里既兴奋又紧张。兴奋的是我一直相信AI能在数学上产生真正的洞见而不是只会做计算紧张的是如果整个学术圈只看到“零错误”这三个字就放松了对证明过程本身的审视那才是真正的危险。我自己的体会是用Lean写证明的那几个月彻底改变了我的数学观。以前我总觉得自己写的证明天衣无缝后来发现只要机器一较真到处都是漏洞。这个过程很痛苦但也让我理解了什么叫真正的“严格”。所以我对AI证明的态度其实很简单只要它能过形式化验证我就愿意认真对待它只要它能走出验证器进入人类的数学体系被引用、被扩展、被讨论我就会承认它是一个合格的数学成果。这次45年数论被攻下如果后续能够被完整复现和验证那它注定会被写进AI与数学交叉的历史节点里。但我觉得最有价值的不是“AI又解了一道难题”而是它逼着我们重新思考什么才算真正的证明什么才算真正的理解。这个问题值得每一个做数学的人认真想下去。
上一篇/下一篇内容由系统自动关联 返回资讯列表 →