AI for AI,关键在于建立AI的物理学
刘子明提出真正的AFAI不是写论文或改训练管线,而是用物理学方法先把研究结构化,再训练原模型预测训练曲线,最终让AI自己发现下一代架构。
核心论点 · 点时间戳可跳到原声
从物理到AI的转型
刘子明本科在北大读物理,后到MIT师从Max Tegmark,早期做AI for physics。ChatGPT出现后,他决定将AI与物理的角色互换,转向physics of AI,即用物理学的方法论理解与设计AI。他把自己和Max都归为“鸟人”,善于在不同领域间迁移方法,这为他对AFAI的独特定义奠定了基础。
— 刘子明用可视化说服Max
KAN是刘子明的成名作,但Max一开始反对,因为1989年论文证明柯尔莫哥洛夫-阿诺德定理的最坏情况下无法变成算法。刘子明作为物理出身,认为不必关心最坏情况,实际宇宙不是最坏的宇宙。他花两周做出原型,再用一周做可视化,Max看到网络内部结构后才惊叹认可。这体现了他“先做出东西再解释”的研究风格。
— 刘子明语言是自然馈赠
刘子明同意谢赛宁的观点:大语言模型是反bitter lesson的。LLM成功的关键在于语言本身,语言是人类演化百万年形成的压缩结果,模型只要能把这份馈赠“吃下去”就能成功,因此对架构要求不高。相反,视觉等模态没有被压缩好,世界模型需要设计能学习抽象表征的架构,这正是后LLM时代模型设计重新重要的原因。
— 刘子明嫁接神经与符号世界
刘子明把自己的研究总结为一条主线:嫁接神经和符号两个世界。AI for science是用神经方法捕捉符号化的科学规律;science of AI反过来用符号和科学方法去理解、改进AI黑盒。他指出大家常说的AFAI大多是从神经到神经,没有闭环到符号部分;他的AFAI是“AI for physics of AI”——用AI加速对AI本身的理解,再指导设计更好的模型。
— 刘子明neo labs涌现的本质
刘子明认为,中美同步出现大量neo labs,根本原因是顶尖人才的选择变了:学界、大厂当大头兵、自己单干之间,越来越多人选择后者。同时当前范式(transformer+scaling)存在明显够不着的洼地,比如AutoResearch和世界模型,需要大量早期研究而非纯堆工程,这些方向恰好是新实验室的生存空间。
— 刘子明资本涌入的两大方向
刘子明判断,当下资本最活跃的方向是世界模型和AutoResearch。世界模型本质是给机器人一个“脑子”,服务机器人赛道;AutoResearch就是训练一个AI研究员去做研究。而AFAI目前多被投资人划到AI for science一类。他亲历融资的体感是“太疯狂了”,投资人相互打探消息、投项目动作极快,种子轮后可以无限加轮。
— 刘子明与RSI的路线差异
刘子明对比田渊栋的Recursive Superintelligence(RSI)和自己的想法。他认为RSI目前的路线更像是一个“勤奋”的coding agent,强调行动力和迭代次数;而他想做的是“聪明”的AFAI,强调提出想法的命中率。他举例说coding agent提100个想法可能只有1个work,而他想让模型提3次就有1个work。两者是正交方向,最终需要整合。
— 刘子明原模型的顿悟时刻
刘子明从今年年初开始把自己当成模型训练:每天随机拉一个数据集和模型,先预测训练曲线再做实验。前四五十天预测能力很差,之后突然变准。这个“人体实验”让他相信原模型(meta model)存在,即输入模型架构等条件,输出训练曲线的模型。有了原模型,AI就能在事前对想法排序、预测实验,大大加速AI研究。
— 刘子明最终产品:training autopilot
刘子明设想的最终产品是一个"training autopilot"。用户不需要知道transformer、不需要懂训练,只要说清需求(比如预算只有100块钱),系统就能端到端地设计、训练、部署模型并交付。他类比说,现在coding让不会写程序的人也能写程序,未来training autopilot让不会训模型的人也能训模型,并孵化各垂直领域的"OpenAI"。
— 刘子明原话 · 已逐字校验
语言是我们人类演化了百万年,相当于是自然给我们的一种馈赠。
语言是我们人类演化了一百万年,相当于自然给我们的一种馈赠。
刘子明18:40
我们这里想做的是AFAI是一个更聪明的FAI。 比如说我提三次想法,可是你们有一个就work了。
我们这里想做的AFAI是一个更聪明的AI。比如我提三次想法,其中有一个就能成功。
刘子明47:41
但我说stop就中间其实还有一步,我们是先要做physics of AI这个东西能够帮助我们去设计AI。
但我说停一下,中间其实还有一步:我们要先做AI的物理学,它能帮助我们去设计AI。
刘子明1:10:46
数字与实体
| 自我训练天数 | 60天 | 49:49 |
| 预测能力开始变准所需天数 | 四五十天 | 50:56 |
| 结构化良好的AI论文占比 | 约1% | 59:07 |
| 预计每日可采集思维链条数 | 200条 | 1:01:12 |
| 预计两个月可采集数据量 | 1万条 | 1:01:12 |
| ResNet相对第二名在ImageNet上的性能优势 | 10% | 1:16:06 |
| 回国时间 | 2026年3月 | 44:35 |
| 融资启动时间 | 2026年5月底 | 44:35 |
术语
- Physics of AIAI的物理学
- 用物理学的思想和方法研究AI,理解其行为并指导设计。
- Mechanistic Interpretability机制可解释性
- 通过拆解网络内部神经元和表征,理解模型内部工作机制。
- Meta Model原模型
- 以模型为输入、输出训练曲线的模型,用于预测AI实验结果。
- Recursive Superintelligence (RSI)递归超级智能
- 让AI不断自我改进,递归地提升自身智能的路线。
收听指南
AI创业者、关注AGI路线和机制可解释性的投资人,以及想理解AI研究前沿的工程师。
开头的个人经历和结尾的爱好问答可跳过,重点听中段关于原模型的路线和融资观察。