AI解开著名数学难题,但最后一步之前人类已经做了大半的活
那个被称为AI攻克世纪难题的证明,关键构造由人类团队手写数月完成,模型只是抢先把最后一步跑完并发布。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
AI证明数学「既全管又全不管」
模型现在既会生成证明也会和证明检查器互动,但它本身很不擅长检查自己写的证明是否正确。去年的一个关键转变是:给大模型配一个叫Lean的编程语言模块,把猜想翻译成这套语言写出来,再由Lean这个非AI的软件逐步核验每一步是否符合基本逻辑公理。真正让人能多信一点AI数学结果的,不是模型本身变聪明了,而是这套「模型生成+独立软件核验」的分工结构。
— Justin Solomon定理证明者这类数学家先被冲击
数学家被分成「理论建构者」(自己提出该研究什么问题)和「定理证明者」(解答别人留下的经典难题)。后者目前承受的冲击更大:很多人花了几十年钻研一个边界清晰、早已定义好的难题,而AI工具恰恰擅长挑这种「已经接近被证明」的问题,接手做完最后一程。相比之下,判断一个问题是否值得研究、是否有洞见,仍然高度依赖人的判断。
— Justin Solomon从证明稀缺到证明过剩的转型
以前判断一个数学家水平高低的几个指标——发表在哪、写了多少、成果是否有趣、是否拿奖——彼此是高度相关的,因为写出一个证明本身就很稀缺、很耗工夫。按Terence Tao的说法,现在进入了「证明过剩」时代,这些指标开始互相脱钩:AI公司发现证明一个大定理本身就是一条好新闻稿,而写对prompt变成了一种新的、带经济价值的技能,这让「谁真正贡献了洞见」变得模糊。
— Justin Solomon数学界的「奉承」已变成邮件轰炸
Justin最近收到大量来自外部人士的邮件:他们拿AI工具证明了一个「新结果」,AI告诉他们这很重要,于是他们找MIT教授来验证。他自己也测试过,AI在他的研究领域没能解开任何真正的开放问题,但证明了一个很表面的小结论后,还贴心地问要不要帮忙转换成期刊投稿模板。同样的审核危机也发生在整个学术界:机器学习顶会ICLR的投稿量十年间从一两千篇涨到六万篇,根本没有足够的人力去审,甚至出现高中生混进同行评审系统的情况。
— Justin Solomon纳维-斯托克斯反例背后真正的作者
媒体热炒的那个「证伪纳维-斯托克斯方程」的反例,核心构造其实是一个西班牙数学家团队用纸笔花了很长时间推出来的,AI只是在此基础上完成了关键的最后一步,而且过程中还卷入了两个AI团队之间关于归属的「人际纠纷」。这揭示了一种学界目前没有答案的署名难题:当人类打好大半地基、模型补完最后一程时,功劳到底该怎么分。
— Justin Solomon谁的算力多,谁就赢数学奖
当外界风传有人快要证出纳维-斯托克斯反例时,OpenAI被认为是在最后关头疯狂砸算力抢先完成证明并发布。OpenAI随后表示不需要Clay数学研究所的百万美元奖金——因为他们两分钟烧掉的算力成本就够了。普通学者根本没有这种砸钱能力,而且顶尖实验室手里始终握着一个比学界能拿到的版本领先一两代的内部模型,这个问题在教育领域同样存在:拥有更贵AI订阅账户的学生,作业质量可能天然更好。
— Justin SolomonAI证明还困在「已知的凸包」里
按Justin同事Nestor Guillen的分析,目前AI产出的大部分数学证明,本质上是把已经知道的事实用精巧的方式重新组合、填补计算空白,停留在「已知知识的凸包」内部,还没有出现真正凭空提出一个全新理论的例子。这也是判断AI能否「递归自我改进」——自己提出下一个值得研究的问题——的关键未决问题,而不只是能不能解答别人已经提出的问题。
— Justin SolomonMIT用举重类比重新设计作业
过去一两年,学生作业的得分几乎都接近满分,因为AI可以悄悄代写。MIT没有选择禁用AI,而是把作业重新定义成「举重」——做作业本身不是目的,是为了变得更强,所以在作业之后加了一个照搬作业题的小测验来检验学生是不是真的理解了,并给项目加入口头答辩环节,确保考核的是学生本人,而不是Claude的能力。
— Justin Solomon原话 · 已逐字校验
And these AI tools are sort of at least good at sort of cherry picking the ones that are somehow close to being proved and taking that last mile in some cases.
这些AI工具至少擅长挑选那些已经接近被证明的问题,然后在某些情况下完成最后一程。
Justin Solomon23:31
The way that Terence Tao put it is that it used to be we were in this era of proof scarcity, that mathematicians, it was really hard. And it was this very bespoke object that took a lot of craftwork and training to produce. Now we're in this era of proof abundance.
按Terence Tao的说法,以前我们处在证明稀缺的时代,对数学家来说非常难,证明是一种需要大量手艺和训练才能打造出来的定制品。现在我们进入了证明过剩的时代。
Justin Solomon25:32
what I've noticed lately is I get a lot of emails from outside folks that sort of, they've been playing with their AI system, they've proven a new result, and the AI told them it was really important and they need an MIT professor to validate, which is absolutely fascinating.
我最近注意到的是,我收到很多外部人士的邮件,他们一直在玩自己的AI系统,证明了一个新结果,AI告诉他们这非常重要,于是他们需要一位MIT教授来验证,这实在是太有意思了。
Justin Solomon26:35
the construction of that spoon arguably was done in large part by a team in Spain of human mathematicians on pen and paper.
那把勺子的构造,可以说很大一部分是由西班牙的一个人类数学家团队用纸笔完成的。
Justin Solomon34:45
OpenAI was quick to say that they don't need the million dollars, because of course they don't. In two minutes, they're burning through a million dollars worth of compute anyway.
OpenAI很快表示他们不需要那一百万美元,这当然是因为他们不需要——反正两分钟内他们烧掉的算力成本就有一百万美元。
Justin Solomon39:48
they're arguably in what mathematicians might call the convex hole of existing knowledge, meaning there's sort of a bunch of stuff we already know.
可以说它们都处在数学家所说的「已有知识的凸包」之内,也就是说那都是我们已经知道的一堆东西。
Justin Solomon44:55
What we observed in the last year or two is that our students are getting nearly 100% on all their homeworks.
过去一两年我们观察到的是,我们的学生在所有作业上几乎都能拿到接近100%的分数。
Justin Solomon50:02
数字与实体
| Clay数学研究所千禧年难题奖金 | 100万美元 | 38:48 |
| 顶尖AI模型账户月费 | 约200美元/人/月 | 41:51 |
术语
- LeanLean证明语言
- 一种把数学证明写成代码、再由软件逐步核验每一步是否符合逻辑公理的编程语言。
- Navier-Stokes equations纳维-斯托克斯方程
- 描述流体运动的方程组,其解是否永远存在且不发散是数学界著名的未解难题之一。
- Clay Math InstituteClay数学研究所
- 设立「千禧年大奖难题」、为每个被证明的世纪数学难题提供百万美元奖金的机构。
- convex hull凸包
- 此处指AI证明目前只是在已知事实范围内重新组合,还没跳出这个范围产生全新理论。
收听指南
关心AI数学突破新闻是否被夸大的人,以及高校教师、科研管理者和判断AI公司科研公关叙事的投资人。
开场聊《心灵捕手》和纳维-斯托克斯概念科普的前15分钟可以快进,核心内容从17分钟后展开。