这几天,数学圈出现了一种很不舒服的热闹。

公开报道描述,一套 OpenAI 内部系统让大量智能体并行处理纳维-斯托克斯方程相关问题,最后还用 Lean 做了形式化验证。另一边,纽约大学数学教授 Tristan Buckmaster 和 Anthropic 数学家 Levent Alpöge 也公开谈到自己的研究进展,并质疑竞争对手是否可能接触到存放在 Codex 里的草稿。

事情还没有走到可以盖棺定论的阶段,很多技术细节也有待独立核验。但有一件事已经足够清楚,AI 正在从参加数学考试,走向参与数学研究。

这两个词差别很大。考试是在有限时间里把题做出来,研究则要在不知道答案的地方,决定往哪里走,哪些路值得继续,什么时候该推倒重来,最后还要让别人能够检查。

AI 智能体围绕数学问题进行文献检索、候选证明、反例检查和形式化验证的协作网络
研究不再是一条单线道路,而是一组可以并行、重启、互相检查的路径。
我的判断是,真正让人紧张的不是 AI 算得比人快,而是它开始拥有一种人类研究者很难长期维持的工作方式,持续执行、随时重启、并行试错,直到把一条模糊的想法推进到可以复核的结果。

一、最先被改变的,不是灵感,而是执行

很多数学突破看起来像一道闪电,某个人突然想到一个漂亮的构造,问题就被照亮了。真实的研究往往没有这么浪漫。

一个想法出现之后,后面还有大量很难讲给外行听的工作。定义要对齐,边界情况要检查,中间的引理要补齐,计算要反复确认,可能还要换一种语言重新写一遍。真正把想法变成证明,常常比想到想法更耗时间。

公开对谈里有一个细节很值得注意。人类研究者遇到一个方向,几天或几周没有进展,通常会因为时间有限而选择放弃。模型没有这种生活成本,它可以在同一个方向上继续执行很久,也可以把同一个问题复制成很多条路线同时推进。

这不等于模型天然更有天赋。它只是没有被日程、挫败感和机会成本逼着立刻做出取舍。过去需要一个人坚持几个月的笨功夫,现在可能被变成一个可调度的计算任务。

但执行不是机械劳动。要知道该执行什么,仍然需要判断。模型不是把所有可能性都试一遍,而是依赖已有知识筛掉大量不值得走的路径,再把精力放到少数候选上。它的优势逐渐从算得快,变成搜索空间缩得准。

二、人类有一种很难摆脱的上下文污染

我很喜欢「上下文污染」这个说法,因为它准确描述了研究中的一种疲惫。

你在一个方向上投入了几天,写了很多笔记,和同事讨论过,甚至已经向别人解释过为什么这条路有希望。后来你发现关键一步走不通,理论上当然可以回到起点,实际上却很难。

失败的细节会黏在原来的直觉上。你会不自觉地维护已经投入的时间,会把一个局部错误解释成暂时困难,会想办法修补旧路径,而不是承认需要重新开始。人脑不是一块可以随时格式化的硬盘,过去的思路会改变你对下一条路的概率判断。

模型也会犯错,也会在一条路上绕圈。但它可以另开一个会话,把问题重新描述一次,换一组假设,或者让另一个智能体从完全不同的方向尝试。对于同一个问题,十条相互独立的探索,比一个人把一条失败路线打磨得越来越精致,更容易撞到真正的突破口。

人类研究者容易被失败路径污染上下文,而 AI 可以通过并行会话重新打开同一个问题
人类的优势不是永远不走弯路,而是最后能知道哪条路值得继续。

这也是 Agent 系统让人着迷的地方。它不是给模型加一个更长的聊天窗口,而是给它一组可以分工、暂停、重启和合并的工作单元。模型负责局部推理,系统负责安排顺序,另一个模型负责检查,最后再由人决定是否接受结果。

三、从近万个智能体到一份可检查的证明

关于这次数学突破,公开文章给出了非常惊人的数字,数千甚至上万个智能体,连续几十小时的推演,数百万条消息,以及最后的 Lean 形式化验证。

数字当然有传播力,但数字本身不是最重要的。更重要的是,研究流程开始被拆成了几个不同的环节。

一部分智能体负责理解题目和检索文献,一部分寻找可能的构造,一部分尝试反例,还有一部分把自然语言证明翻译成形式化语言。每个环节都可以失败,也可以把失败记录留给下一轮。最后留下的不只是一个看起来很漂亮的结论,而是一条别人可以重新运行、检查和质疑的证据链。

Lean 的意义也在这里。形式化验证不能保证一个问题值得研究,更不能替你决定一个证明在现实里意味着什么。但它可以把大量低级错误挡在门外,减少「这一步好像没问题」带来的侥幸。

过去,一个数学家发表证明,读者需要用自己的时间逐行检查。以后,AI 可能先把证明写出来,再由形式化系统检查结构。人的工作不会消失,只是从亲自搬运每一块砖,转向检查建筑是否建立在正确的地基上。

四、真正的争议在证明之外

如果故事只停在 AI 解出难题,数学家大概会惊讶,但不会这么快变成伦理争议。

麻烦来自时间线。公开信息显示,Buckmaster 和 Alpöge 在 OpenAI 发布前已经拿到了一些关键中间结果,而且研究中使用过 Claude 和 Codex。OpenAI 则表示没有读取对方未公开的工作,并称模型不会查看用户数据,但同时又留下了无法完全排除训练数据影响的谨慎表述。

这类争议不能靠情绪解决,也不能因为模型给出了正确答案,就跳过来源和署名问题。一个证明是对的,不代表获取它的过程天然正当。一个模型没有直接打开某个文件,也不等于训练、评测、提示和产品数据之间的边界已经被所有人理解。

以后科研机构需要面对的,可能不只是「AI 能不能做出这个结果」,还包括三个更麻烦的问题。它使用了哪些材料,谁对问题提出了关键方向,谁应该获得署名和荣誉。

如果一个模型在公开论文、用户草稿和内部研究之间形成了复杂的知识回路,传统的优先权规则会变得不够用。研究者需要比以前更早地留下时间戳、版本记录和可审计轨迹,平台也需要明确哪些数据可以用于改进模型,哪些数据只能留在用户自己的边界内。

速度越快,过程越需要留下证据。否则我们得到的只是更快的结果,不是更可靠的知识。

五、数学家担心的不是 AI 太聪明,而是它太快

有位菲尔兹奖得主表达过一种很复杂的担忧。一道猜想不只是一个等待答案的盒子,它还是一座灯塔。人类花很多年去进攻它,沿途会形成直觉,会走过弯路,会顺手发现一批原本没有计划寻找的东西。

如果 AI 在一个周末里把问题推到终点,人类可能少走很多弯路,也可能少获得很多沿途的发现。

这对年轻研究者的冲击尤其明显。博士生选择一个方向,往往意味着把人生几年交给它。如果任何重大猜想都可能被一组拥有巨大算力的智能体迅速完成,年轻人还应该怎样建立自己的研究直觉,怎样判断一个问题值得坚持,怎样获得属于自己的学术身份。

这不是一句「人类也要拥抱 AI」就能解决的问题。教育制度、学术评价和研究资助都建立在时间投入与个人成果之间的关系上。当执行成本大幅下降,评价体系必须重新定义什么叫贡献。

也许未来最重要的成果,不是第一份由 AI 写出的证明,而是人类如何保留那些不能被速度替代的东西,问题的品味、概念的解释、失败的经验,以及让知识继续生长的共同体。

六、AI 的品味,暂时仍然需要人来叫醒

公开对谈里还藏着一个很重要的细节。模型完成了被交代的任务之后,并不一定会主动把结果推到极致。只有当人追问「能不能再往前一步」,它才继续挖出更深的结构。

这说明任务导向仍然很强。模型可以拥有很强的执行能力,却未必知道哪个方向最值得探索。它需要一个问题,需要一条边界,也需要有人判断什么时候不能满足于当前答案。

我觉得这就是现在人类比较稀缺的优势。不是人类比模型更会做每一个局部步骤,而是人类还可以把问题放回现实,问它为什么重要,会改变谁,是否值得消耗这些算力,结论是否能被别人理解。

AI 进入数学研究后,速度、证明和意义构成新的分工三角,人类负责问题、解释与责任
真正的研究价值,不会只由速度决定,还要同时满足证明、意义与责任。

这也改变了我们理解「学术品味」的方式。过去它像一种只可意会的经验,知道什么问题漂亮,知道什么时候该换路,知道一个技术细节为什么值得追。以后,AI 可能在局部判断上越来越强,但人仍然需要把这些判断放进更大的知识地图里。

七、普通人可以从这场变化里学到什么

我们不需要等到自己开始研究流体方程,才会遇到同样的问题。

写一份方案、做一次市场调研、排查一个复杂故障,其实都包含长程执行。最容易失败的做法,是让 AI 一次性给出最终答案,然后用流畅程度判断质量。

更好的方式是把任务拆成可复核的工作链。先让它复述目标和未知,再让它并行提出几条路径;每条路径都记录假设、证据和失败条件;最后让一个独立角色攻击结论,再由人决定是否执行。

我自己现在越来越少要求 AI 「直接做完」。我更愿意让它先告诉我,准备怎么做,哪些地方最可能错,怎样证明已经做对。这样做有一点慢,但它把真正重要的判断留在了桌面上,而不是藏在一段很顺滑的文字里。

当然,任务越简单,越没有必要把流程搞得像科研项目。查一个固定命令、改一个明确的文件、整理一段已经确认的文字,直接做就好。只有当问题含混、代价高、多人协作或结果需要承担责任时,才值得给 AI 配置这样的研究回路。

结语,答案变快以后,问题更贵了

当 AI 只能回答问题时,我们担心它会不会胡说。当 AI 开始自己搜索、自己试错、自己验证时,真正昂贵的事情就变了。

答案会越来越便宜,问题会越来越贵。

什么值得研究,什么值得继续,什么结果应该公开,什么数据不能被使用,谁来解释一个复杂结论,谁来承担它进入现实之后的后果,这些都不是更大的模型自动能够解决的事。

所以,人类还剩下什么优势?不是永远比 AI 算得快,也不是每一步都比 AI 做得好。我们真正要守住的,是选择方向的能力,是把结果放回现实的能力,是在速度之外仍然看得见意义和责任的能力。

AI 可能会在一个周末里走完一条人类走了几十年的路。

但路通向哪里,为什么要走,走到终点之后要把什么带回来,这些问题,仍然需要有人在场。