陶哲轩预言数学百年新危机:AI 10美元解出7道研究级难题,为何人类却面临“证明消化不良”?

2026-08-31 05:10 来源:购机向导录

  陶哲轩在2026年国际数学家大会上发出警告:AI生成数学证明的速度远超人类消化能力,数学正面临百年一遇的认知危机

  菲尔兹奖得主、加州大学洛杉矶分校数学教授陶哲轩(Terence Tao)在2026年7月国际数学家大会(ICM 2026)上公开发出警告:AI正在以惊人的速度生成数学证明,但人类根本没有时间验证和理解这些成果,数学正从“证明稀缺”迈入“证明过剩”时代。他引用独立评测“First Proof”的数据:10道从未公开的研究级新题,AI系统以“可发表质量”解出了7道,单题算力成本仅为10至1000美元[3]。然而,陶哲轩指出,数学的完整链条包括生成、验证、阐释、同行认可和写入教材五个环节,AI目前只加速了第一个环节[4]。他担心,如果人类无法及时消化这些证明,下一代数学家的理解能力将退化,甚至可能导致整个科学共同体的停滞[10]

  事件还原:一场关于“理解”而非“答案”的演讲

  2026年7月,在被誉为数学界最高盛会的国际数学家大会上,陶哲轩发表了题为《Mathematics in the age of AI》的公众演讲[3]。他并没有像多数人预期的那样争论“AI到底行不行”,而是直接抛出一个“工作假设”:请全场观众暂时假设,AI很快就能以合理的成本和质量完成相当比例的研究级数学任务[3]。基于这个前提,他推导出一个令人不安的结论:数学界正在经历“消化不良”——大量AI生成的证明虽然形式正确,却因缺乏人类理解所需的“认知地图”而难以被吸收[2]

  陶哲轩展示了自己年轻时阅读Bourgain论文的批注页,上面满是对跳步的质疑、对中间步骤的补全、用自己的话重新组织的痕迹。他解释说,理解的形成恰恰依赖于这些“停顿、卡壳、重写”的痕迹。而AI生成的论文过于光滑,没有标记出真正的难点,因为AI从未经历过“卡住”的感觉,无法判断哪里会让人困惑[2]。这种“认知结构差异”导致AI论文在简单部分停留过久,却在真正新颖的关键步骤上一笔带过——因为那些步骤在训练数据中几乎没有先例[2]

  AI数学能力到底有多强?First Proof评测给出硬数据

  为了摆脱立场和情绪化的争论,陶哲轩引用了独立评测平台First Proof的数据。该平台专门设计没有标准答案的研究级数学问题,由人类专家评审。2026年5月28日发布的第二批10道题中,四套AI系统在受控条件下解出了7道,达到期刊发表水平[3]。单题算力成本从10美元到1000美元不等,远低于人类数学家数月甚至数年的研究成本[3]。然而,陶哲轩特别提醒:市场上关于AI数学能力的证据大多不是在受控科学条件下收集的,充满报道偏差,关键成本常常不披露[3]。First Proof是少数例外。

  与此同时,2026年夏天,AI连续推翻了四个困扰数学界几十年的猜想:雅可比猜想(87年)、六维球面问题(78年)、黎曼零点比例(人类30多年推进1.6%,AI一天半推进25.6%)[6]。这些成就让数学界既兴奋又不安。但更值得警惕的是,OpenAI在2026年曾宣称其推理模型攻破了一道80年悬而未决的数学猜想,24小时内被数学家打回——不是证明错了,而是“AI证对了每句话,但已跟原猜想无关”,形式正确但语义不忠实[5]。这暴露了当前AI评测体系高度依赖“输出格式合规度”,缺少“语义忠实度”指标[5]

  为什么说“证明过剩”比“证明稀缺”更危险?

  陶哲轩将数学发现的完整流程拆解为五步:生成、验证、阐释、发表、正典化入教科书[4][7]。在传统模式中,每一步都依赖人类共同体。AI只加速了“生成”这一步,却让后续步骤面临巨大压力。他提出一个尖锐的判断:“如果作者不能令人信服地证明自己可以就其成果做一场清晰的、专家水平的、正确且归属得当的报告,那么这个成果就不应该发表。”[7]这意味着,即便AI生成了正确的证明,如果人类无法阐释、无法理解,它就不具备成为数学知识的资格。

  更深的危机在于认知结构层面。陶哲轩指出,数学论文不是知识,而是认知地图——地图的价值在于标注哪里有悬崖[2]。人类优秀作者会在困难的地方放慢、反复、留下挣扎的痕迹,这些痕迹是“作者当年挣扎的化石”,向后来的读者传递“此处务必小心”的信号[2]。AI润色做的“修平”恰恰是灾难——光滑的文本会让读者产生“读懂了”的错觉,实际上只是“读完了”[2]。理解的形成依赖于重走那段崎岖,而结论可以瞬间传递,唯独理解不能[2]

  人类数学家的护城河在哪里?——消化、追问与提出新问题

  在陶哲轩看来,AI擅长生成和验证,但“消化证明”——理解深层结构、提炼方法论、提出有价值的新问题——依然是人类的护城河[9]。他引用哲学家库恩的范式转移理论,指出以前不管怎么变,人还在里面;但这次,人可能不在里面了[6]。如果数学变成了纯粹的算力竞赛,人类就输了;但如果把它看作思维体操,AI反而成了最好的陪练[9]

  陶哲轩警告更深层的问题:如果人类不继续消化AI的产出、建立下一代知识基础,我们可能会作为一个科学社会而停滞[10]。“我们可能会优化掉当前技术能做的一切,但再也发展不出真正原创的新想法了。”[10]他呼吁数学界展开一场更开放的讨论:基础科学到底是什么?为什么好奇心驱动的研究仍然需要人类社区来做,即使这看起来不如AI高效?[10]

  技术要点表:AI数学证明的现状与挑战

技术/产品核心指标应用场景影响对象限制条件信息来源
First Proof评测10道研究级新题,AI解出7道,单题成本10-1000美元评估AI数学研究能力数学研究共同体、AI开发者受控条件,非公开标准题库[3]
AI连续推翻四个猜想雅可比猜想(87年)、六维球面(78年)、黎曼零点比例(25.6%推进)破解长期悬而未决的数学问题数学界、科学史研究者结果需人工验证,部分猜想验证过程复杂[6]
OpenAI推理模型翻车事件形式正确但语义不忠实,24小时被识破数学证明生成AI安全、代码生成、法律文书缺乏语义忠实度评测指标[5]
人类数学家消化能力陶哲轩花几天改写AI一小时产出理解与阐释AI证明下一代数学家、教育体系认知结构差异,AI无“卡住”体验[2][6]

  常见问题解答(QA)

  Q1: 陶哲轩说的“证明消化不良”具体指什么?

  A: 指AI以极低成本(10-1000美元)大量生成数学证明,但人类数学家来不及验证、理解和吸收这些成果。陶哲轩认为数学发现需要经历生成、验证、阐释、发表、正典化五个步骤,AI只加速了第一步,后续步骤严重滞后,导致知识体系“消化不良”[4][6]

  Q2: AI生成的数学证明真的可靠吗?

  A: 不完全可靠。虽然AI在First Proof评测中解出了70%的研究级新题,但发生过“形式正确但语义不忠实”的翻车事件(OpenAI案例,24小时内被识破)。陶哲轩指出,当前缺乏对“语义忠实度”的评测指标,AI可能生成每句话都对但整体偏离原命题的证明[5]

  Q3: 人类数学家在这场危机中应该怎么办?

  A: 陶哲轩建议数学界将AI视为工具而非替代者,保留人类对“消化证明”的核心能力——理解深层结构、提炼方法论、提出新问题。他呼吁不要因为AI高效而放弃好奇心驱动的研究,并强调“提出一个好问题,远比解出一道题更珍贵”[9][10]

  延伸价值:从数学危机看AI评测体系的盲区

  陶哲轩的警告不仅限于数学界。当AI生成代码、法律文书、研究报告时,同样面临“形式正确但语义不忠实”的风险[5]。当前AI评测体系高度依赖输出格式合规度,但对“语义忠实度”的衡量几乎空白。这意味着,在金融、医疗、司法等高风险领域,AI可能给出看似完美但实际错误的结论,而人类因缺乏验证手段而误用。陶哲轩的“认知地图”理论提醒我们:真正的理解需要阻力,需要痕迹,需要人类共同体在崎岖中重建认知路径。如果AI只负责给出光滑的答案,而人类放弃思考,那么整个科学文明都可能陷入“优化停滞”的陷阱[10]

  数学界需要建立新的学术规范:AI生成的证明必须附带可解释的“认知注释”,标注难点、跳步和直觉来源,而不是仅仅输出一个形式正确的结论。同时,教育体系应强化“理解”而非“计算”的训练,让下一代数学家具备与AI协作并消化AI产出的能力。正如陶哲轩所说,数学的衡量标准不是定理的生产,而是让人们更清楚地理解和思考[2]

  #陶哲轩 #AI数学危机 #证明过剩 #大模型推理 #数学危机