世界太吵,来原声听播客

a16z

AI 能证明定理,却还提不出值得问的问题

多伦多大学数学家 Daniel Litt 说,模型最擅长把已知技巧用到极致,但数学真正的价值在于理解——而理解目前还留在人脑里。

AI 数学推理能力学术激励形式化验证模型边界

原视频在 YouTube 上放不出来,用音频听:

一位一线数学家对 AI 数学能力的诚实校准:哪些结果真让他改观,哪些只是标题党。信息密度高,适合想听内行判断的人。

核心论点 · 点时间戳可跳到原声

3:09

最让他改观的是单位距离问题

Daniel 说,到目前为止他最喜欢的完全自主 AI 结果是 Erdős 单位距离问题的解,大约五月中旬公布。他之所以看重它,是因为这个结果有点创造性:它从 60 年代的经典想法里借来技巧,但这些技巧对研究平面点构型的人来说是新的。而且事后证明它很有生产力——一批数学家拿这些想法去构造了其他开放问题的反例,比如实数上的和积猜想。他把这称为目前他知道的唯一一个「事后看确实带来了新理解」的自主结果。

— Daniel Litt
6:11

模型的推理链看起来非常像人

主持人问这是否是「非人的」逻辑推演,Daniel 反驳说,他认为这个论证非常人类。OpenAI 放出的一些思维链在他看来完全可以辨认——如果他想象自己解题时的思维链,大概就长那样。他说他研究过的大多数结果都是这样:不像有什么「第 37 手」的神来之笔,就是一个人类数学家在做人做的数学。模型唯一显得非人的地方是不知疲倦、知道得多。

— Daniel Litt
9:13

数学可验证这个说法被高估了

Daniel 说,很多人说数学是可验证领域,所以 AI 进步快。但他的判断是:模型主要在扩展非形式化推理,而不是 Lean 证明,所以这些技术很可能泛化到其他领域。他还指出,大量数学训练数据并不反映数学家怎么思考——论文是打磨过的,教科书几乎不展示动机,所以想跟上研究方向,通常得直接跟研究者聊。

— Daniel Litt
10:15

模型强在应用已知技巧,弱在直觉

Daniel 说,模型的结果有固定风味:依赖它们的长计算能力,或把许多领域、许多论文里的技术想法拼起来。但它们在直觉和大局观上更弱。他描述自己的工作方式:先有一个非常不严格的哲学,觉得这个东西类比于那个东西,然后努力把它精确化。而目前最好的模型结果里,看不到多少这种推理。他强调,非常擅长应用所有已知技巧本身是强大的,也有数学家靠这个做出高质量工作,但那只是数学家关心的一小片窄带。

— Daniel Litt
29:42

人证不出来,反而逼出了更好的定理

Daniel 讲了他唯一一篇模型有用的论文。有个引理他想证,所有前沿模型都证不出来。于是他自己算了一堆例子,意识到也许有个更好的陈述,找到之后模型很快就证明了那个更好的版本。他说,现在把原来那个引理丢给 ChatGPT 5.6 Pro,它会输出你见过最糟的证明——十页残酷计算,毫无洞见。那个证明本身没错,但不会带来这个更漂亮的概念性解释。他说自己当时意识到这个丑陋的证明可行,但实在下不去手,所以去找了另一个论证。

— Daniel Litt
35:45

现有激励正在批量生产垃圾论文

Daniel 说,数学的目标不是生产论文,而是生产理解。但现在的激励结构不鼓励人真正投入。他描述了一个实验:让 Codex 上网找五篇代数几何的近期猜想并证明它们,来回几次后,一小时内就得到三篇很糟但正确的论文,现在躺在他硬盘上。他说 arXiv 上投稿量暴涨,很多明显低质量,甚至同一证明、同一定理在几天内出现三到五篇。他认为这不一定是模型变好就会消失的问题。

— Daniel Litt
37:45

一千个数学家还是一个数学家复制一千次

Daniel 说,数学的进步来自让一千朵花开放,人们追随自己的好奇心,知识边界以某种相对均匀的方式扩张,然后机会主义地出现应用。他担心的是:如果让数学探索从属于模型想追求的东西,你得到的可能是一个数学家被复制一千次,而不是一百万个数学家做一百万件不同的事。主持人补充说,如果实验室推出来的证明都收敛在相似的东西上,因为它们技术上依赖同一批文献,那这种多样性直觉从哪里来就不清楚了。

— Daniel Litt
52:13

模型证明短,是因为它检查不了长的

有人夸模型证明短而漂亮,Daniel 的判断相反:它们不产出又长又复杂的证明,是因为做不到——检查正确性的能力还不够。他说,就算让模型写短证明,你再问它这对不对,它经常自己说不对。长证明的问题是模型可能不知道自己错了。他举例:OpenAI 最近放出的十个问题都在 Lean 里形式化了,这是它们为真的有力证据;他毫不怀疑还有更多没法形式化的,因为前置引理还没进 Mathlib。他还提到有人贴出 800 页 AI 生成的奇点消解证明,他说这绝不可能是对的。

— Daniel Litt

原话 · 已逐字校验

I actually think the argument was very human.

我其实认为这个论证非常人类。

Daniel Litt6:11

It's like a human mathematician doing math. It's like a human mathematician doing certain types of math.

就像一个人类数学家在做人做的数学。就像一个人类数学家在做某几类数学。

Daniel Litt7:12

the goal of mathematics is not to produce mathematics papers. Um, like it's to produce some kind of understanding.

数学的目标不是生产数学论文,而是生产某种理解。

Daniel Litt34:44

a lot of progress in mathematics comes from like letting you know, a thousand different flowers bloom and people pursue their own curiosity

数学的很多进步来自让一千朵不同的花开放,让人们追随自己的好奇心。

Daniel Litt37:45

if what you're getting is like one mathematician duplicated a thousand times or like actually you know a million different mathematicians doing a million different things.

你得到的是一个数学家被复制一千次,还是一百万个不同的数学家在做一百万件不同的事。

Daniel Litt38:46

they will still sometimes produce things that are just wrong and they know they're wrong.

它们有时还是会产出就是错的东西,而且它们自己知道是错的。

Daniel Litt53:13

there's no way it's correct. Like, this will be a major result.

它绝不可能是对的。那会是一个重大结果。

Daniel Litt54:13

数字与实体

Erdős 单位距离问题 AI 自主解公布时间五月中旬3:09
Codex 一小时产出的论文数3 篇很糟但正确的论文35:45
OpenAI 形式化发布的问题数10 个,全部在 Lean 中形式化53:13
AI 生成的奇点消解证明页数800 页54:13
Daniel 女儿能可靠计算的数字范围30 以内可靠,50 半可靠59:31

术语

LeanLean 证明助手
一种形式化数学证明的编程语言与验证器,证明可被机器逐行检查。
MathlibMathlib 数学库
Lean 生态中规模最大的形式化数学定理库,前置引理需先入库才能形式化新证明。
Erdős unit distance problemErdős 单位距离问题
平面点构型中关于单位距离出现次数的经典问题,长期被认为有上界,后被反例推翻。
sum product conjecture和积猜想
实数上关于加法与乘法不能同时保持小集合的猜想,后被构造出反例。
resolution of singularities奇点消解
代数几何中把奇异簇化为光滑簇的经典定理,正特征情形长期未完全解决。

收听指南

谁该听

对 AI 数学能力有判断需求的工程师和研究者,以及想知道「模型到底强在哪、弱在哪」的技术决策者。

可跳过

最后十分钟聊女儿学数学和二十面体玩具,与主线判断无关。