Poolside:小模型的持久性,比参数量更重要
Poolside用总参1180亿、激活80亿的小模型证明,持久性和验证行为比单纯堆参数量更能提升编程能力,这让他们相信开源小模型能打破巨头垄断的未来。
核心论点 · 点时间戳可跳到原声
一篇博客,四年后烧光1200万美元
2015年Karpathy那篇讲RNN的博客让他连夜把公司方向转向用神经网络写代码,此后四五年里团队把RNN、LSTM、Transformer都试了一遍,方向是对的,却没意识到唯一要做的其实是继续扩大规模。团队烧掉1200万美元投资人的钱,他称之为职业生涯最大的失败,之后两年他基本没再碰语言模型,直到ChatGPT发布,他才等来某种迟到的平反。
— Eiso Kant宁要100家基础模型公司,不要5家
Poolside创立之初和大多数实验室一样,不打算做开源。转折发生在今年年初:他们意识到世界正走向一个只有三四家公司决定所有智能未来的剧本,这在他看来更像反乌托邦小说而非科幻理想。因为自己还没跑到前沿,做这个决定的代价还不算高——他坦言真到了前沿位置,恐怕已经无法回头。于是他们选择开放研究和权重,理由很直接:宁可活在有100家基础模型公司的世界,也不要只剩5家,哪怕自己就是那5家之一。
— Eiso Kant模型工厂:8周训完一个模型
Poolside把模型训练当工业流程设计:三年前行业标配是先打包数据集、拷贝到训练集群再分发,一改数据就要重新打包,极费时间。他们转为把数据流式喂进训练,数据层保持不可变,每个token都能溯源到具体代码版本,两年前的实验仍可完全复现。团队不到70名研究员、35名工程师,月跑1万到2万次实验:Laguna XS2从开训到发布5周,Laguna S用8周,S一完成就当天开始训练更大的Medium。他现在看到的多是agent在写代码、跑实验、评估结果——递归自我改进的早期苗头。
— Eiso Kant小模型靠死磕,不靠更聪明
应用研究负责人Peng Ming告诉Eiso,Laguna S的进步更多来自行为变化而非更强的智能:更多验证、不轻易过早宣称成功、更持久地死磕问题。这款1180亿总参数、80亿激活参数、能塞进一台DGX Spark的小模型,独立解出了Erdős 397问题,也能在没有网络的情况下靠反复摸索底层API写出一个Wi-Fi扫描器。这让Eiso开始怀疑:知识工作(占全球经济约25%、合25万亿美元)所需模型规模的性价比拐点,可能远比他此前设想的要低——但他强调这不是反对继续做大模型,只是小模型里还有很多没被榨干的空间。
— Eiso Kant怀疑堆RL环境是不是走偏了
Eiso认为强化学习会越来越早地介入训练过程,而不只是训练完成后的后处理阶段——他把DeepSeek的R1-Zero论文视为业界最早的公开信号,即模型刚学会用语言时就能被诱导出推理行为。他直言当下整个行业有两种正在上瘾的「毒品」:一个是蒸馏,一个是不断堆砌更多RL环境,两者都让模型变好、让人感觉良好,但他坦承并不确定这是不是通往AGI的正确道路,也不确定网页数据里的信息是否已经被next-token predict充分榨取。
— Eiso KantMCP和工具调用是「蠢」的设计
Eiso两年来一直坚持一个不太受欢迎的观点:MCP和传统工具调用其实很蠢。他的逻辑是,复杂长程任务本质上是在和数据源与系统打交道,与其在模型和系统之间插入MCP或工具调用层,不如直接给模型一个装好各种库、文档和API密钥的代码仓库,让它自己写代码、用if和for循环完成任务——RL训练出来的模型本能上就想这么干。他预测12个月内不会再有系统提示词里塞着二三十个工具的做法,但Poolside目前仍支持工具调用和并行工具调用,因为业界普遍还没转过来。
— Eiso Kant限制开放模型,可能造就新的寡头
Eiso反对任何一家公司单方面决定谁能用自己的模型去开发基础模型——他认为这类限制应该交给民主决策,而不是少数公司自己拍板。他举例说,禁止香烟广告本身是对的,但客观上造就了烟草行业的寡头垄断,因为新进入者再也无法靠打广告建立品牌。他担心类似的锁定效应会发生在AI上:一旦以现在的模型能力水平就开始限制开放模型,等于提前替未来判了死刑,而他认为当下的模型能力还远没有危险到需要这么做的地步。
— Eiso KantRL的瓶颈不是GPU数量,是批大小
预训练可以用整个互联网当数据,batch size几乎可以无限扩大;但RL训练受限于任务/环境数量有限,batch size没法这样放大,这让RL训练时间成了真正的瓶颈,而不是GPU数量本身。Eiso因此很期待把推理里prefill/decode分离、用专用硬件处理不同阶段的思路搬进RL训练,也提到几天前刚看到一篇用比Poolside现有FP8更低精度做RL训练的博客。他反复强调:这是一场以日历时间而非GPU数量计算的比赛,缩短RL训练的墙钟时间可能是当下最能给全行业提速的杠杆。
— Eiso Kant原话 · 已逐字校验
I had built a completely unreasonable belief, that neural nets should be able to generalize to anything and everything, and that language should be able to generalize, to a lot of things that are intelligent and the ability to write code.
我当时形成了一个完全没道理的信念:神经网络应该能泛化到任何事情上,而语言应该能泛化出很多智能的东西,包括写代码的能力。
Eiso Kant1:05
I rather live in a world that has 100 foundation model companies than a world that has five, even if I was one of the five.
比起只有5家基础模型公司的世界,我宁愿活在有100家的世界里,哪怕我自己就是那5家之一。
Eiso Kant6:21
The model that we’re gonna talk about today was eight weeks from start of training, to launch. We started the next model literally yesterday because we now finished the post-training required for the model we’re launching, next week or by the time this comes out today.
我们今天要谈的这个模型,从开始训练到发布只用了8周。下一个模型我们昨天就已经开始训练了,因为我们刚完成这次要发布的模型所需的后训练——就是下周,或者这期节目上线的时候。
Eiso Kant18:18
I have the feeling that a lot of the gains in Laguna S come not from more intelligence, but more from different behavior, more verification, less taking things for granted, not declaring victory early, and being way more persistent.
我感觉Laguna S的很多进步并非来自更强的智能,而是来自不同的行为方式——更多验证、更少想当然、不过早宣布胜利,以及更加持久地坚持。
Eiso Kant35:46
we’ve got some drugs in the industry. One of the drugs is distillation. Another drug is, more environments. Like, and they’re great, and they make us feel good, and they make the models better, and like we’re all addicted to them, and we’ll use them, right?
我们这个行业现在有几种「毒品」:一种是蒸馏,另一种是不断堆砌更多环境。它们确实很好用,让我们感觉良好,也确实能让模型变强,我们都对它们上瘾,也都会继续用。
Eiso Kant44:39
I think MCP and tools are stupid.
我觉得MCP和工具调用都很蠢。
Eiso Kant1:09:28
I always think back about when we banned advertising on cigarettes. Good thing. I’m not saying I’m against that. But it effectively established an oligopoly of cigarette companies because no one else could ever compete.
我总会想起当年我们禁止香烟打广告这件事。那是件好事,我不是说反对它。但它实际上造就了烟草公司的寡头垄断,因为再也没有别人能和它们竞争了。
Eiso Kant1:31:53
The race is measured not in how many GPUs, but the race is measured on calendar time, and that’s probably one of the biggest impacts we can have right now to speed up our industry.
这场竞赛衡量的不是你有多少块GPU,而是日历时间,而这可能是我们现在能为整个行业提速所做的最大贡献之一。
Eiso Kant1:36:25
数字与实体
| Sourced失败烧掉的投资 | 1200万美元 | 2:29 |
| Poolside研究员/工程师人数 | 不到70名研究员,另有35名工程师 | 18:18 |
| Laguna XS2训练周期 | 开训到发布共5周 | 18:18 |
| Laguna S训练周期 | 开训到发布共8周 | 18:18 |
| Laguna S参数规模 | 总参数1180亿,激活参数80亿 | 54:34 |
| 知识工作占全球经济比例 | 约25%,合25万亿美元 | 38:05 |
| 新一代Laguna Medium训练周期 | 39天 | 1:18:19 |
| Poolside融资规模 | 5亿美元 | 1:23:09 |
术语
- RSI递归式自我改进
- AI系统自己改进AI研发流程的能力,被视为逼近AGI的信号
- MCP模型上下文协议
- 让模型调用外部工具/数据源的标准协议,Eiso认为不如让模型直接写代码
- FP8/NVFP48位/4位低精度训练
- 用更低数值精度训练模型以省算力,是Poolside押注的方向之一
- DGX Spark英伟达桌面级AI计算设备
- 可在单台设备上跑百亿参数模型的小型算力盒子
- prefill/decode disaggregation预填充/解码分离
- 推理中把处理提示词和生成回答拆到不同硬件,Eiso想搬进RL训练
收听指南
基础模型公司的研究/工程负责人,以及关注开源模型生态和RL训练瓶颈的投资人。
1:20:40附近Poolside名字由来和融资趣闻偏轶事,信息量较低,可跳过。