17岁AI原住民:学数学的理由,变成了向大学证明能吃苦
AI 出现后,他学数学的理由退化成向大学证明自己能吃苦:原来能看到的大学、读博、推进数学那条路变窄了,身边想做航天的同学也在失去向上的动力。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
预训练像魔幻,后训练像塑身体
他做预训练的理由不是论文,是手感:后训练更像塑造一个身体,预训练是把你那个具体的材料变得更好、来承受之后的塑造,他说这件事有点 magical。代价是真的烧钱——这篇论文他一共烧了三万块钱,论文里最大的模型只有 0.05B;要扩大规模,他算出来差不多还要六千块。那天晚上他特别紧张,在想要不要花这笔钱,因为即使论文很好,投顶会也可能被拒,钱就白花了。最后是哥哥和父母都支持他,他才迈出这一步,而扩大规模这一步做成了。
— 苏廷浩三个模型没 save,1500 白白烧掉
他形容训练是一个昂贵的游戏。有一次他忘了训练会定期存 checkpoint,同时训三个模型,三个都没 save,参数也没挑好,丢掉 1500。他说自己都哭了,特别特别伤心,反复想为什么之前不把那段再看一遍。这段没有任何高深的东西:一个高二学生踩的正是所有做预训练的人最日常的坑——钱花在算力上,一次低级失误就归零。他妈妈宽慰他说交了学费就长记性,他之后也没再犯这种错误。他也承认自己训练代码很 messy,只有他一个人会用,训练效率有很大问题。
— 苏廷浩他把 attention 的宽度切成两半
论文的起点是 Value Residual Learning:把第一层的 attention value 加到后面几层做残差。他发现低层的 value 在做两件事——本层使用,以及加到后面层做残差——于是把第一层的 attention projection 宽度翻倍,切一半留给本层、另一半专做向后的残差,再加上 RMSNorm,并把做法从 value 扩展到 key 和 query,效果更好。他知道这跟 Kimi 的 attention residual 看起来很像,但他说是完全两种思路:Kimi 残差的是 hidden state,他残差的是 attention projection。他自己也清楚哪条更 work——Kimi 那条路已经被 2.5T 的规模证明,他的是小规模结果。
— 苏廷浩GPT 框架只要高中数学,难在直觉
他的判断是,现在 Transformer 和 GPT 的大框架并不需要多高深的数学或者概率思维,都是矩阵相乘,高中数学差不多就能理解;真正要花时间的是培养直觉。例子就是他自己:一年多前看 Andrej Karpathy 那套二十来小时的视频,只能跟着他写什么自己写什么,完全没有理解,然后这些东西在脑子里沉淀了半年到一年,才突然理解一些。所以他的 aha moment 不是学会一个公式,而是某天突然想通 QKV——Q 代表我这个字想寻找什么,K 代表我这个字是什么、别人可以用它来找我,V 是你找了我之后具体取走什么信息。
— 苏廷浩一生中前 20 开心的时刻在下棋
ICML 第一天晚上七点到九点有个象棋社交活动,房间里都是棋盘,你找个人就能跟你下。他把这称为自己一生中前二十最开心的时候:走过去问一句你的研究方向是什么,一边下棋一边聊 AI,几天里见了很多从各地来的人,还能继续下棋。他在那几天还做了一件很他自己的事——遇到每个人都会问一句 AI 会不会导致人类灭绝,那段时间问了大概 30 到 35 个人。他也说这次从韩国回来以后自己变了,原来的性格偏内向,现在偏外向一些。
— 苏廷浩应用公司挣得多,但只能听上游
他的分工说得很直白:模型公司负责把模型做好,应用公司最终只是在上面加点东西,改不了具体的模型,也是靠模型来挣钱,所以只能听模型公司。但他同时给出一个反直觉的判断——现在来看,应用公司比模型公司挣更多的钱,因为现在好像除了那几家,模型公司都在烧钱、都没有利润。而他把终局推得更狠:如果真有公司做出 AGI,AGI 可以自己写应用软件,直接把应用公司替掉。他也说,每个想做 AGI 的公司都必须说自己要做 AGI,这样才能融资,最终目标还是挣钱。
— 苏廷浩学数学只剩向大学证明能吃苦
他把 AI 带来的变化讲得很具体:以前学物理化学,你能看到自己比一部分人好,能一路看到大学、读博、推进这门学科;现在即使没学过的人,也能一键问 AI 得到一个比你更好的回答。于是他的动机变了——学数学不再是为了这门科目,而是向大学证明自己是一个能吃苦、能学习的人。他身边对航天物理很感兴趣的同学也在想,以后 AI 可能做得比自己更好。他用「变窄了,变更困难了」来形容这条路,失去的是一部分为科目、为人类做贡献的使命感。
— 苏廷浩从 ICML 到支教,他刻意关掉 AI
从韩国 ICML 回来四五天,他就去农村支教,反差是他自己讲的:ICML 上所有人说的都是最先进的 AI,谁家的模型怎么样;到了支教的地方,每天想的是明天该背什么课,晚上是去农场散步还是去旁边抓昆虫。他会有意识地让自己在这段时间离开 AI,多跟同学、一起来的人和小孩交流,玩游戏。他连续几年去支教,做的是同一件事:当地小孩用中文字来记英文发音,他花五百多人民币在淘宝买礼品,设计了一套积分的机制,让孩子上课回答问题、参加游戏来换,报名只收 30 个人,最后要靠村长打电话才能进来。
— 苏廷浩原话 · 已逐字校验
后训练更像塑造一个身体吧 预训练更像是你把那个具体的材料 变得更好来承受之后的后训练的塑造 预训练有点那个magical 有点像魔幻一样
后训练更像塑造一个身体,预训练更像是你把那个具体的材料变得更好、来承受之后后训练的塑造。预训练有点那个 magical,有点像魔幻一样。
苏廷浩11:13
要是AI能被人类控制的话 而且很强的话 一些控制AI的人 就能变为那个神了 因为它能控制 无所不能的AI 然后其他人 就可能会变成蝼蚁了
如果 AI 能被人类控制、而且很强,那么一些控制 AI 的人就能变成神,因为他能控制无所不能的 AI,其他人就可能会变成蝼蚁。
苏廷浩23:21
现在来看这个 应用公司是比模型公司 挣过更多的钱 因为现在除了好像 安斯拉北家公司都在烧钱 都没有那个profit
现在来看,应用公司比模型公司挣过更多的钱,因为现在好像除了那几家,模型公司都在烧钱,都没有利润。
苏廷浩29:22
现在的AI 你可能觉得 我其实学数学 我只是为了 给大学证明 我是一个能吃苦 能学习的人 而不是为了这个科目 而学习
现在的 AI 会让人这样想:我学数学,只是为了向大学证明我是一个能吃苦、能学习的人,而不是为了这门科目而学。
苏廷浩38:26
KimiK3出现那一天 我高兴了一天 因为呢 我那时候以为 那个国内 或者Open Source模型 需要那个几个月 才能追上的 但是发现 其实没那么的长的时间 就可以追上了
Kimi K3 出现那一天我高兴了一天,因为我那时候以为国内或者开源模型需要几个月才能追上,结果发现没那么长的时间就追上了。
苏廷浩49:30
我若是应该 之前告诉自己 抓紧这个时间 能离开这些东西 就是别多想 跟你同学 跟你这次来的人 跟你这次的小孩 就多交流 玩一些游戏 比如浪人杀 捉迷藏 就故意告诉自己 别多想这些AI的东西
我告诉自己抓紧这段时间,能离开这些东西就离开、别多想,多和你的同学、这次一起来的人、这些小孩交流,玩玩狼人杀、捉迷藏,就故意告诉自己别去想 AI 这些东西。
苏廷浩56:34
AI的智商 当它提升 所有AI的智商都提升 但是人类都是一代人 一代人 它都经历 这个缓慢的成长期 所以我们的培育 其实是比AI慢很多的
AI 的智商一旦提升,所有 AI 的智商都提升;但人类是一代一代人,都要经历这个缓慢的成长期,所以我们培育的速度其实比 AI 慢很多。
苏廷浩1:06:43
数字与实体
| ICML 2026 收录论文 | 1 篇 | 3:07 |
| 论文训练总花费 | 3 万元人民币 | 11:13 |
| 扩大规模的预估花费 | 约 6000 元人民币 | 11:13 |
| 三个模型未保存 checkpoint 的损失 | 1500(原文未说明币种) | 13:13 |
| 从零手写 Transformer 的最快用时 | 约 25 分钟 | 14:13 |
| 每天读一篇论文的挑战 | 连续 30 天 | 5:08 |
| 支教活动淘宝礼品花费 | 500 多元人民币 | 53:31 |
术语
- Attention Projection Mixing with Exogenous Anchors论文标题
- 他被 ICML 2026 收录的论文题目,改的是 attention projection 的残差方式。
- Value Residual Learning值残差学习
- 把第一层 attention 的 value 加到后续层做残差的既有方法,他论文的起点。
- fineweb edu开源预训练数据集
- 他免费拿来训练模型的公开数据集,最大用到 20B。
- UBI全民基本收入
- 他在十年后预测里提到的设想:大部分人不用工作,在家吃喝。
收听指南
关注 AI 对教育与人才影响的投资人、做 AI 教育产品的人,以及想知道 05 后究竟怎么用 AI 的工程师。
8 到 11 分钟的象棋、奥数与竞赛经历可以快进。