25位菲尔兹奖得主警告:拿数学当AI跑分的代价
25位菲尔兹奖得主联名声明,称AI公司把解题当基准正伤害数学共同体。访谈解读解题与理解的错位、署名与传承链危机,以及HN评论区的质疑与反驳。

这周数学圈有个少见的场面:25位菲尔兹奖得主在mathandai.org联名发布宣言,说AI公司把解题当基准的做法正在伤害数学本身,签名里有陶哲轩、Deligne、Scholze。HN讨论很快转向另一个问题:是不是被抢了饭碗才出来说话?我请来老朋友沈知远——数学博士出身,现在在一家大模型实验室做推理评测,两头都是他的现场。我们聊了聊解题和理解差在哪,宣言漏掉了什么,以及它和做AI产品的人有什么关系。
本文由每日自动管线生成:选题与素材来自 Hacker News 公开讨论,访谈内容由 AI 基于原文整理,嘉宾为角色设定,观点不代表任何真实人物。
小听: 知远,先问你的第一反应。你白天的工作就是给推理模型出题、打分,看到25位菲尔兹奖得主联名说“别拿数学当跑分”,是被点名的感觉,还是被理解的感觉?
沈知远: 两种都有,所以想认真聊聊。宣言的核心其实就一句话:解题只是手段,概念理解和洞见才是目的。他们把著名难题比作灯塔——解出一道大题的价值不在答案,而在背后那套新方法会被社区花几年时间消化、简化,最后写进教科书,让研究生甚至本科生都能学。这个慢速消化链,才是数学真正的生产方式。
小听: 可在做评测的人看来,这条链太慢了。模型一个月能清掉一批悬置多年的猜想,速度本身就是进展吧?没人会嫌灯塔亮得快。
沈知远: 宣言里最狠的一句是:以越来越快的速度批量生产“真/假”命题,可能不是给思想注入生命,而是在毁掉沃土。你看实际流程:成果匆匆宣布,没人有时间写正式论文、提炼新方法、补上对前人工作的引用,署名和抄袭的争议立刻就来了。更深一层是,AI想出来的东西,必须有数学家愿意花时间去验证、整合进已有的体系,它才算真正“活”了。愿意做这件事的人跟不上,人类数学家之间的传承链就断了。

流水线只负责产出,不负责消化。
小听: 所以全文的题眼是misalignment,目标错位。这个词我们做AI的天天用来形容模型和人类意图,这次被他们拿来形容公司和学科。
沈知远: 这是宣言最准的框架。AI公司要的是一个可测量、可刷、能代表智能水平的基准;数学界要的是理解和传承。而基准一旦变成目标,就不再是好指标——工具反噬目的。宣言还补了一个很有分量的观察:数学界像是人类社会的缩影,最珍贵的资源是学生和想法,都得用十年为单位养出来。基准驱动的产出方式,恰好整个绕过了这个养成过程。
小听: 评论区第一枪打的就是这个。有人说,宣言把“给出替代机制”的责任全推给AI公司,通篇没讲数学界自己打算怎么改。有意思的是评论区引述陶哲轩的解释:情况太紧急,来不及像莱顿宣言那样走充分的协商程序,只能先发。这个“先发再说”你买账吗?
沈知远: 我会把它当成一份政治声明来读,不是政策白皮书。它的功能是划线、定性,把“目标错位”这个词钉进公共讨论——具体机制确实没给,这是短板,评论区抓得对。但“来不及协商”我部分买账:署名规则、成果归属这些事一旦成为既成事实,再谈就晚了。警告本来就该在损害发生之前发出,等所有程序走完,那不叫警告,叫验尸报告。
小听: 还有一个更市场派的反驳:既然是技术革新动摇了旧机构的根基,凭什么要求革新者负责收拾烂摊子?当年外包把制造业城市掏空的时候,也没人要求跨国公司先给出替代方案。
沈知远: 商业逻辑里这话成立,但数学有个特殊位置:它是基础设施。宣言专门写了,现代技术和科学都建立在数学工具之上。数学真正的资产不是存量定理,而是“能提出新问题的人”这条生产线。这条线的维护成本没人直接付,坏掉的代价也是弥散的、十年后才显形——正因为没有任何一方需要对它负责,才需要有人提前喊。这不是“公司要不要赔”,是公共品没人认领。
小听: 最辣的一条来了:有人说数学论文大部分本来就是slop,还翻旧账——格罗滕迪克当年就批评过Deligne证明韦伊猜想的路数。你们要守的“纯粹传统”,是不是从来就没存在过?
沈知远: 评论区里 _flag 那句回击很到位:Deligne 和 Scholze 本人生产 slop 吗?拿最顶尖的个体去反驳一个关于平均值的判断,确实不对等——说这话的人自己也承认 Scholze 不算。但我真正想说的是,这段黑历史反而支持宣言:数学圈内部一直有平庸产出的问题,以前靠社区慢速消化来过滤;现在加上批量生成和署名混乱,等于把老毛病放大一个数量级,还额外叠加了归因这一层。
小听: 还有一条不好接的:外包把整座城市变成废墟时没人在乎,轮到特权阶级受冲击,就开始要求“替代机制”。这份宣言是不是知识精英的自救?
沈知远: 该问,而且半认。数学家现在才体验到很多行业早经历过的冲击,这个不舒服是真实的。但宣言有意思的地方是它自己把这层讲穿了:多年的训练本来是为了长出“提出新问题的能力”,而AI现在能直接输出训练的最终结果——这对所有智力劳动都成立,不只数学。他们叫数学界“人类的缩影”,我更愿意叫它金丝雀:矿井里的金丝雀不是唯一会中毒的,只是最先有反应的。从高地位行业内部先发出信号,传播效率确实不一样。

先有反应的,往往是笼子里的那只。
小听: 拉回你的本职。对天天设计benchmark和eval的AI从业者,这份宣言有什么能搬走的东西?
沈知远: 两条。第一,代理指标会反噬:你把“答对”当目标,就会得到一批擅长“长得像答案”的系统,而不是“理解了”的系统——你的eval决定模型往哪长,宣言里“工具反噬目的”在产品里同样成立。第二,消化环节是价值的一部分:模型给出证明不算完成,能被写清楚、被独立验证、接进已有体系才算,所以“产出速度”这个指标本身就是错的。宣言最后把决定权交给“掌握这项技术的人类”,听着像免责声明,其实是把球踢给了在座每个人——包括做评测的我们。一句话总结:一个没人能消化的证明只是个事实,数学不缺事实,缺的是把事实变成公共工具的那条传送带。
这份宣言最值钱的不是结论,而是它给目标错位找了一个最体面的案例:连数学这种最吃慢功夫的学科,也会被解题速度这类代理指标带偏。至于评论区那句是不是轮到自己才喊疼,我倒觉得不必急着站队——金丝雀先有反应,不等于只有金丝雀会中毒。本文观点仅代表访谈角色设定,原始讨论见参考链接。