原创内容

AI正毁掉数学?25位菲尔兹奖得主担忧的并非机器会做题

陶哲轩、邓煜等25位菲尔兹奖得主联合警告,人工智能企业若持续把数学难题当作能力标尺,技术目标可能与数学研究目标严重错位。真正需要防范的不是工具变强,而是评价标准、验证机制与人才培养被单一竞赛逻辑牵着走。

数学研究者在黑板与电脑之间审慎思考人工智能对研究方向的影响
数学研究者在黑板与电脑之间审慎思考人工智能对研究方向的影响
本文目录

“AI正毁掉数学”并不是说计算机一旦会解题,数学就会消失。争议的核心在于:当人工智能企业把数学难题当成衡量模型能力的赛场,最容易机器化、最方便展示成绩的问题,可能获得远超其学术价值的资源;而数学真正重视的概念创造、问题选择、严谨验证和长期积累,反而可能被挤到一旁。

当地时间9月11日,陶哲轩、邓煜等25位菲尔兹奖得主发表联合声明,警告人工智能快速用于解决数学问题,可能使AI发展目标与数学研究目标出现“严重错位”。声明所关注的重点,不宜被简化为数学家排斥新工具,也不能被夸张成数学研究已经遭到摧毁。更准确的问题是:谁在选择要解决的问题,结果怎样被验证,研究价值又由什么标准决定?

为什么“会做题”不等于“推动数学”

数学研究当然需要得到正确答案,但答案只是终点之一。一项工作是否重要,还要看它是否提出了有价值的问题、建立了新的概念联系、形成可复用的方法,并让其他研究者能够理解和检验。模型在某道题上输出一段看似完整的证明,并不能自动满足这些要求。

大型语言模型解决重大数学问题的能力近年来大幅提升,这是联合声明讨论的现实背景。不过,从“模型能够生成证明”到“模型完成了可信研究”,中间仍隔着多层判断:

  • 问题是否重要:一道题很难,不代表它对某个数学分支具有长期价值。
  • 论证是否严密:局部推导正确,不代表整条证明链没有遗漏条件或循环论证。
  • 结果是否新颖:模型可能重新组合已有材料,是否形成真正的新方法需要专业判断。
  • 过程是否可追溯:研究者必须知道使用了哪些前提、工具与资料,不能只接受一个无法解释的结论。
  • 成果是否可复现:其他人应当能够独立检查,而不是依赖一次偶然输出。

因此,把数学能力压缩为“攻克多少难题”,就像用考试分数概括全部教育质量:它能反映一部分能力,却无法代替完整评价。想进一步理解这场争议的背景,也可以参阅站内的25位菲尔兹奖得主警告AI伤害数学的事件梳理。

真正的风险是研究目标被评测指标牵引

企业需要清晰、可比较的技术指标,数学题天然适合充当测试材料:题目边界相对明确,答案往往可以核查,模型之间也容易比较。但科研共同体面对的并不是一张固定试卷。许多重要进展来自重新定义问题、连接不同领域,甚至发现原来的提问方式并不合适。

如果资源持续流向“容易形成排行榜成绩”的题目,可能产生三种偏移。第一,研究者花费更多时间整理适合机器挑战的问题,而不是探索真正值得研究的问题。第二,平台更重视快速宣布结果,验证工作却由人数有限的数学家承担。第三,年轻研究者可能误以为研究就是不断完成高难度任务,忽略阅读、讨论、失败与长期构造的重要性。

需要警惕的不是人工智能参与数学,而是技术展示的需要反过来决定数学应该研究什么。

多位数学研究者围绕纸面推导展开同行核验与讨论
多位数学研究者围绕纸面推导展开同行核验与讨论

机器给出证明后,谁来承担核验成本

数学成果不能靠“看起来合理”过关。模型可以在短时间内生成大量候选证明,但专业核验仍然需要逐步检查定义、引理、边界条件和引用关系。生成速度提高,并不意味着审查速度同步提高。当候选结果大量涌入,数学界可能面临明显的成本转移:企业获得能力展示,期刊编辑、审稿人和研究团队却承担筛选与纠错压力。

一个负责任的使用框架,至少应回答以下问题:

  1. 来源能否说明:是否记录模型版本、输入条件、外部工具与人工修改过程。
  2. 证明能否检查:关键步骤是否转换为人类可读、可逐条验证的形式。
  3. 责任是否明确:出现错误时,不能把责任推给模型,提交者仍需对成果负责。
  4. 贡献如何标注:提出问题、设计方法、生成候选与完成验证应当区分。
  5. 资源如何分配:用于能力测试的题目,不应自动获得高于基础研究的学术地位。

这里的原则与其他数字工具并无本质冲突:工具可以加速检索、计算和探索,但可信成果仍要经过独立验证。正如辨别仿冒软件不能只看图标和名称,面对模型生成的数学结果,也不能只看形式是否像证明。站内关于如何核验信息来源与风险信号的实用方法,同样体现了“外观不能代替验证”的基本思路。

学生和普通使用者应该停止用AI学数学吗

没有必要一概停用。合理使用可以帮助学习者获得提示、比较不同解法、检查符号计算,也可以把抽象概念换一种方式解释。问题出在把生成结果直接当成标准答案,或者在尚未形成基本推理能力时,把思考环节全部交给工具。

更稳妥的四步使用法

  1. 先独立作答:写下已知条件、目标和尝试过的方法,哪怕没有完整答案。
  2. 只索取有限提示:先让工具指出可考虑的定理或反例,而不是立即生成全部过程。
  3. 逐步反问依据:检查每一步用了什么条件,主动寻找不成立的边界情况。
  4. 脱离工具复述:关闭页面后重新写出思路;无法复述,通常说明尚未真正理解。
大学生先在纸上推演数学问题并用平板电脑辅助核对
大学生先在纸上推演数学问题并用平板电脑辅助核对

学校也不宜只靠禁止应对。更有效的做法,是增加口头解释、过程性作业、现场推导和错误分析,让学生说明“为什么这样做”。阅读与推理能力从来不是由篇目数量或工具有无单独决定的,相关讨论可参考课纲变化与阅读能力之间究竟是什么关系。同理,评价数学学习也应观察思维过程,而不只是最终答案。

如何避免AI与数学研究走向对立

这场警告的建设性意义,在于推动技术界和数学界提前建立边界,而不是等问题扩大后再补救。企业可以公开评测题目的选择原则,区分“模型能力演示”与“数学研究贡献”;研究机构可以制定使用记录、署名和复核规范;期刊与会议则需要明确机器生成内容的披露及验证要求。

与此同时,应当给核验工作足够的时间和认可。发现一段证明为何不成立,可能比生成它更困难;整理高质量数据、构建形式化验证工具,也不应被视为次要劳动。只有把这些成本纳入评价,技术进步才不会以透支数学共同体为代价。

因此,“AI正毁掉数学”更适合作为一个风险提醒,而不是已经完成的事实判断。人工智能可能成为数学家的计算器、检索助手和探索伙伴,也可能在错误激励下把研究变成追逐可展示成绩的竞赛。决定结果的并非工具本身,而是目标由谁设定、成果由谁验证,以及学术共同体是否保有判断什么问题真正重要的权力。

版权声明:本文由本站编辑原创撰写,未经授权请勿转载。撰写日期:2026年9月12日。

本站编辑原创,发布日期:2026年09月12日 16时14分27秒(北京时间)