世界太吵,来原声听播客

Theories of Everything with Curt Jaimungal

AI物理学的真正瓶颈不是算力不够,而是描述语言不够好

数学已经有证明验证工具让AI能自我迭代改进,物理没有——同一个『谜题』换一套描述框架就变得显而易见,真正卡住进展的是语言,不是智力。

AI与科研物理学学术界数学证明描述语言AGI

原视频在 YouTube 上放不出来,用音频听:

讲清AI对科研的真实冲击而非泛泛而谈:数学证明提前两年成真,物理学家自己承认想错了时间线。

核心论点 · 点时间戳可跳到原声

1:02

一场数学证明提前两年成真

2026年3月,Math Inc.用AI自动证明了Maryna Vyazovska凭此获菲尔兹奖的高维球堆积问题。Gorard原本预计这要到2027年末甚至2028年才会发生,结果提前了大约两年。他的反应不是「AI真强」,而是「我想问题想错了,时间线完全错了」——这不只是改了科研规划,而是改了他对整个人生的规划。更严重的是,学术界根本没有时间适应这个变化。

— Jonathan Gorard
6:18

学术界靠模糊两字融资百年

学术界一直刻意模糊「science as product」(解决真实问题)和「science as process」(驱动好奇心)的界限:用后者为前者融资,声称好奇心终会产生有用的东西。他举例,数论研究者常声称自己的工作与密码学相关,但现实中密码学用的都是千年前就有的数学。这套正当化系统花了上百年才建立起来,而一旦AI能独立完成「product」,就没人再需要为「process」付钱了。

34:25

数学有验证工具,物理没有

这是AI在不同学科进展悬殊的关键原因。AI在coding和数学上的突破依赖形式验证工具——compiler、Lean、Agda这类proof assistant,让AI能无监督自我改进,因为它能立刻知道自己对不对。但物理、化学、生物、工程都没有对应的验证管道。Hilbert在20世纪初就想为物理做数学那套形式化工作,但失败了。正因缺这套工具,AI在自然科学上的进展远落后于代码和数学。

45:08

观察本身早已带着理论

物理和数学的根本区别在于:数学不需要处理「实验验证」,物理必须处理。Kuhn和Hanson早就指出不存在「纯粹观察」——任何观察都在某个理论框架内发生,无论是语义层面(「检测到一个粒子」背后藏着几十层理论假设)还是知觉层面(光学错觉就是明证)。想自动化科学推理,不能简单把观察和预测做匹配,必须把整个理论框架空间都参数化进去。

54:16

AI能力曲线来自工具链不是模型

Gorard的判断是:当前AI能力提升不来自transformer模型本身的改进,而来自post-training、reinforcement learning、harness、tools、skills这类周边构造。他认为transformer对启动这轮革命很关键,但最终不会是关键部分——验证这个假设的办法很简单,把底层LLM换成扩散模型,同时保留所有post-training和reinforcement learning管道,看结果是否一样。

— Jonathan Gorard
1:33:05

物理的谜其实是语言的卡

一个看起来是「基础之谜」的东西,其实只神秘于某一个特定模型。黑洞面积定律在广义相对论里很神秘,但换到边界场论的对偶描述里就是热力学,「totally obvious」;波粒二象性在粒子框架里看不懂,换到波的框架里就理解了。Gorard由此推论:很多「物理卡壳」其实是描述语言卡壳,不是现实本身设下的限制。

— Jonathan Gorard
1:46:44

他最怕AI自动化掉的是快乐

Gorard对老一辈学者欣然拥抱Claude做研究感到困惑——他们说「太好了,我可以用它读论文、解方程、写代码」,他的反应却是「等等,那正是我喜欢的部分」。这暴露了一个代际分歧:不是AI能力够不够的问题,而是谁来拥有「思考的快乐」。他对这种工作方式的抵触并不新,年轻时就已经对17世纪浪漫的自然哲学与如今充满调试的计算物理之间的落差感到失望。

— Jonathan Gorard
1:59:17

AI真正瓶颈是描述语言不是算力

Gorard把整集的发现收束成一句话:AI能力当前被描述语言卡住,这不是说AI不够聪明,而是说现在用来表达物理学的形式语言还不够好。如果缺少验证管道,AI反而会导致「溶液化」——能生成假说、能写论文,却没有能力检查理论一致性或实验有效性,结果是假说爆炸但没有实质理解进展。问题在工具,不在模型。

— Jonathan Gorard

原话 · 已逐字校验

The output happens more or less independently of the input or the process. And so now the justification mechanisms that exist societally don't exist anymore.

成果与投入和过程基本脱钩了。于是社会层面那套用来正当化科研的机制也就不存在了。

Jonathan Gorard13:31

anytime you make an observation, anytime you perform a measurement, you are doing so relative to an existing theoretical framework.

任何一次观察、任何一次测量,都是相对于某个既存的理论框架而进行的。

Jonathan Gorard46:10

the curve in AI capabilities at the moment is not coming from improvements in the transformer model. It's coming from improvements in post-training, reinforcement learning, harnesses, tools, skills, all these kinds of things.

当下AI能力的上升曲线不是来自transformer模型本身的改进,而是来自post-training、reinforcement learning、harness、tools、skills这些东西的改进。

Jonathan Gorard54:16

we're getting smarter not because our brains are getting better, but because our tools are getting better.

我们变聪明不是因为大脑变好了,而是因为工具变好了。

Jonathan Gorard56:17

the pleasure for me was in you know was in writing out the equations it was in figuring out the algorithms it was in thinking about these questions it was in reading you know other people's thoughts about these things the idea that uh reducing frictions in those areas was somehow a good was completely alien to me

我的快乐在于写出方程、设计算法、思考这些问题、阅读别人在这些事情上的思想。「减少这些地方的摩擦是件好事」这种想法对我来说完全陌生。

Jonathan Gorard1:46:44

数字与实体

AI证明球堆积难题与Gorard预期时间线之差约2年(提前)3:04
一次观察背后隐含的理论假设层数20-50层47:10
Gorard认为实验物理相对安全的时间范围2年内1:42:37
Gorard归纳的描述语言历史演进阶段数4个:自然语言、几何、分析、计算1:57:17

术语

description language描述语言
用来表达和建模物理/数学现实的形式语言体系
proof assistant证明助手(如Lean、Agda)
能机器核验数学证明每一步是否严格成立的软件工具
Sapir-Whorf hypothesis萨丕尔-沃尔夫假设
语言结构会塑造使用者思维方式的假说
slopification溶液化
AI大量生成未经验证的假说和论文导致研究失序的风险
Flynn effect弗林效应
人类平均智力测验得分随时间持续上升的现象
harnessAI工具编排框架
围绕模型搭建的工具调用、技能和流程控制层,而非模型本身

收听指南

谁该听

关心AI对科研/学术体系真实冲击的研究者、做AI产品或投资AI的人,以及想理解『AI瓶颈到底卡在哪』而非泛泛焦虑的人。

可跳过

中段关于理解可传递性与教育哲学的讨论较学术化,可快进。