陶哲轩在2026年国际数学家大会上发出警告:AI生成数学证明的速度远超人类消化能力,数学正面临百年一遇的认知危机
菲尔兹奖得主、加州大学洛杉矶分校数学教授陶哲轩(Terence Tao)在2026年7月国际数学家大会(ICM 2026)上公开发出警告:AI正在以惊人的速度生成数学证明,但人类根本没有时间验证和理解这些成果,数学正从“证明稀缺”迈入“证明过剩”时代。他引用独立评测“First Proof”的数据:10道从未公开的研究级新题,AI系统以“可发表质量”解出了7道,单题算力成本仅为10至1000美元[3]。然而,陶哲轩指出,数学的完整链条包括生成、验证、阐释、同行认可和写入教材五个环节,AI目前只加速了第一个环节[4]。他担心,如果人类无法及时消化这些证明,下一代数学家的理解能力将退化,甚至可能导致整个科学共同体的停滞[10]。
事件还原:一场关于“理解”而非“答案”的演讲
2026年7月,在被誉为数学界最高盛会的国际数学家大会上,陶哲轩发表了题为《Mathematics in the age of AI》的公众演讲[3]。他并没有像多数人预期的那样争论“AI到底行不行”,而是直接抛出一个“工作假设”:请全场观众暂时假设,AI很快就能以合理的成本和质量完成相当比例的研究级数学任务[3]。基于这个前提,他推导出一个令人不安的结论:数学界正在经历“消化不良”——大量AI生成的证明虽然形式正确,却因缺乏人类理解所需的“认知地图”而难以被吸收[2]。
陶哲轩展示了自己年轻时阅读Bourgain论文的批注页,上面满是对跳步的质疑、对中间步骤的补全、用自己的话重新组织的痕迹。他解释说,理解的形成恰恰依赖于这些“停顿、卡壳、重写”的痕迹。而AI生成的论文过于光滑,没有标记出真正的难点,因为AI从未经历过“卡住”的感觉,无法判断哪里会让人困惑[2]。这种“认知结构差异”导致AI论文在简单部分停留过久,却在真正新颖的关键步骤上一笔带过——因为那些步骤在训练数据中几乎没有先例[2]。
AI数学能力到底有多强?First Proof评测给出硬数据
为了摆脱立场和情绪化的争论,陶哲轩引用了独立评测平台First Proof的数据。该平台专门设计没有标准答案的研究级数学问题,由人类专家评审。2026年5月28日发布的第二批10道题中,四套AI系统在受控条件下解出了7道,达到期刊发表水平[3]。单题算力成本从10美元到1000美元不等,远低于人类数学家数月甚至数年的研究成本[3]。然而,陶哲轩特别提醒:市场上关于AI数学能力的证据大多不是在受控科学条件下收集的,充满报道偏差,关键成本常常不披露[3]。First Proof是少数例外。
与此同时,2026年夏天,AI连续推翻了四个困扰数学界几十年的猜想:雅可比猜想(87年)、六维球面问题(78年)、黎曼零点比例(人类30多年推进1.6%,AI一天半推进25.6%)[6]。这些成就让数学界既兴奋又不安。但更值得警惕的是,OpenAI在2026年曾宣称其推理模型攻破了一道80年悬而未决的数学猜想,24小时内被数学家打回——不是证明错了,而是“AI证对了每句话,但已跟原猜想无关”,形式正确但语义不忠实[5]。这暴露了当前AI评测体系高度依赖“输出格式合规度”,缺少“语义忠实度”指标[5]。
为什么说“证明过剩”比“证明稀缺”更危险?
陶哲轩将数学发现的完整流程拆解为五步:生成、验证、阐释、发表、正典化入教科书[4][7]。在传统模式中,每一步都依赖人类共同体。AI只加速了“生成”这一步,却让后续步骤面临巨大压力。他提出一个尖锐的判断:“如果作者不能令人信服地证明自己可以就其成果做一场清晰的、专家水平的、正确且归属得当的报告,那么这个成果就不应该发表。”[7]这意味着,即便AI生成了正确的证明,如果人类无法阐释、无法理解,它就不具备成为数学知识的资格。
更深的危机在于认知结构层面。陶哲轩指出,数学论文不是知识,而是认知地图——地图的价值在于标注哪里有悬崖[2]。人类优秀作者会在困难的地方放慢、反复、留下挣扎的痕迹,这些痕迹是“作者当年挣扎的化石”,向后来的读者传递“此处务必小心”的信号[2]。AI润色做的“修平”恰恰是灾难——光滑的文本会让读者产生“读懂了”的错觉,实际上只是“读完了”[2]。理解的形成依赖于重走那段崎岖,而结论可以瞬间传递,唯独理解不能[2]。
人类数学家的护城河在哪里?——消化、追问与提出新问题
在陶哲轩看来,AI擅长生成和验证,但“消化证明”——理解深层结构、提炼方法论、提出有价值的新问题——依然是人类的护城河[9]。他引用哲学家库恩的范式转移理论,指出以前不管怎么变,人还在里面;但这次,人可能不在里面了[6]。如果数学变成了纯粹的算力竞赛,人类就输了;但如果把它看作思维体操,AI反而成了最好的陪练[9]。
陶哲轩警告更深层的问题:如果人类不继续消化AI的产出、建立下一代知识基础,我们可能会作为一个科学社会而停滞[10]。“我们可能会优化掉当前技术能做的一切,但再也发展不出真正原创的新想法了。”[10]他呼吁数学界展开一场更开放的讨论:基础科学到底是什么?为什么好奇心驱动的研究仍然需要人类社区来做,即使这看起来不如AI高效?[10]
技术要点表:AI数学证明的现状与挑战
| 技术/产品 | 核心指标 | 应用场景 | 影响对象 | 限制条件 | 信息来源 |
|---|---|---|---|---|---|
| First Proof评测 | 10道研究级新题,AI解出7道,单题成本10-1000美元 | 评估AI数学研究能力 | 数学研究共同体、AI开发者 | 受控条件,非公开标准题库 | [3] |
| AI连续推翻四个猜想 | 雅可比猜想(87年)、六维球面(78年)、黎曼零点比例(25.6%推进) | 破解长期悬而未决的数学问题 | 数学界、科学史研究者 | 结果需人工验证,部分猜想验证过程复杂 | [6] |
| OpenAI推理模型翻车事件 | 形式正确但语义不忠实,24小时被识破 | 数学证明生成 | AI安全、代码生成、法律文书 | 缺乏语义忠实度评测指标 | [5] |
| 人类数学家消化能力 | 陶哲轩花几天改写AI一小时产出 | 理解与阐释AI证明 | 下一代数学家、教育体系 | 认知结构差异,AI无“卡住”体验 | [2][6] |
常见问题解答(QA)
Q1: 陶哲轩说的“证明消化不良”具体指什么?
A: 指AI以极低成本(10-1000美元)大量生成数学证明,但人类数学家来不及验证、理解和吸收这些成果。陶哲轩认为数学发现需要经历生成、验证、阐释、发表、正典化五个步骤,AI只加速了第一步,后续步骤严重滞后,导致知识体系“消化不良”[4][6]。
Q2: AI生成的数学证明真的可靠吗?
A: 不完全可靠。虽然AI在First Proof评测中解出了70%的研究级新题,但发生过“形式正确但语义不忠实”的翻车事件(OpenAI案例,24小时内被识破)。陶哲轩指出,当前缺乏对“语义忠实度”的评测指标,AI可能生成每句话都对但整体偏离原命题的证明[5]。
Q3: 人类数学家在这场危机中应该怎么办?
A: 陶哲轩建议数学界将AI视为工具而非替代者,保留人类对“消化证明”的核心能力——理解深层结构、提炼方法论、提出新问题。他呼吁不要因为AI高效而放弃好奇心驱动的研究,并强调“提出一个好问题,远比解出一道题更珍贵”[9][10]。
延伸价值:从数学危机看AI评测体系的盲区
陶哲轩的警告不仅限于数学界。当AI生成代码、法律文书、研究报告时,同样面临“形式正确但语义不忠实”的风险[5]。当前AI评测体系高度依赖输出格式合规度,但对“语义忠实度”的衡量几乎空白。这意味着,在金融、医疗、司法等高风险领域,AI可能给出看似完美但实际错误的结论,而人类因缺乏验证手段而误用。陶哲轩的“认知地图”理论提醒我们:真正的理解需要阻力,需要痕迹,需要人类共同体在崎岖中重建认知路径。如果AI只负责给出光滑的答案,而人类放弃思考,那么整个科学文明都可能陷入“优化停滞”的陷阱[10]。
数学界需要建立新的学术规范:AI生成的证明必须附带可解释的“认知注释”,标注难点、跳步和直觉来源,而不是仅仅输出一个形式正确的结论。同时,教育体系应强化“理解”而非“计算”的训练,让下一代数学家具备与AI协作并消化AI产出的能力。正如陶哲轩所说,数学的衡量标准不是定理的生产,而是让人们更清楚地理解和思考[2]。
#陶哲轩 #AI数学危机 #证明过剩 #大模型推理 #数学危机