顶级闭源模型黑了一家公司,靠开源模型才自救成功
Misha Laskin说,闭源实验室的安全研究员全球加起来只有几百人,补不了长尾漏洞;那次事件里公司最终是靠开源模型自保的,这是他说的经验证据。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
中国开源模型逼得公司转向自建
Reflection最初的打算是站在别人训练好的开源基座模型上做强化学习研究,但大约一年后发现,当时所有好用的开源模型都来自中国,西方没有像样的开源基座可用。同时他们在研究中发现一个关键事实:要让强化学习在大规模上真正好用,你其实需要自己预训练模型——两件事耦合得太紧,分不开做。这两个原因加上企业和地缘政治层面的考量,促使他们决定端到端自己做一个开放模型。
— Misha Laskin强化学习吃掉的算力比预训练还多
Beam是5000亿参数的模型,230亿是激活参数。预训练用了6000张GB300跑了几周(基础设施优化后现在能压到12天左右);但强化学习阶段用了略超1万张GB300,跑了整整4周——花在RL上的浮点运算实际上比预训练还多。原因是RL阶段既要做大规模推理,又要维护各种agent用的沙盒环境,复杂度更高。
— Misha LaskinBeam比同级模型快3到4倍
Misha强调模型建设里一个常被忽视的维度:不只是能力高低,而是agent多快把事情做完,这直接决定了客户的成本和等待时间。Beam在同等能力级别下比同类模型快3到4倍,面对更大的模型时效率优势能拉到10倍左右。他把这归功于强大的预训练推理基础,叠加了他认为是开源领域目前规模最大的一次强化学习训练。
— Misha Laskin开源token份额半年内反超闭源
从OpenRouter、Vercel这类网关的数据看,大约6个月前token消耗是70%闭源、30%开源,现在几乎正好反过来,变成70%开源、30%闭源。Misha预计这个趋势还会加速,世界会越来越像操作系统市场——Linux跑在95%以上的服务器上,但微软和苹果依然是价值极高的公司。他的判断是:多数token会流向开源,但顶尖的闭源模型公司和开源生态周边的发行商也都会活得很好。
— Misha Laskin开源模型是基础设施的特洛伊木马
Misha的类比是:开源模型本身用处有限,真正被锁定的是围绕它的整套软件和基建生态,就像当年5G光纤布局和一带一路——谁给别的国家提供了便宜好用的技术,谁就获得了商业和地缘政治杠杆,这跟稀土资源的逻辑类似。他预判中国公司比如华为很快会提供全栈方案,让使用国锁进其供应链;放在算力和数据中心是新时代『铁路』这个框架里看,没有自己铁路的国家都得依附某一方。
— Misha Laskin闭源模型黑了别家公司,靠开源自救
面对『开源不安全』的指控,Misha的反驳是网络攻防很难真正分开——拿掉进攻性能力的同时也拿掉了防御能力。他举的具体案例是:一次事件里,某家公司遭到一个强大闭源模型的攻击,而它自己想用现有最先进的闭源模型来防御时,却因为那些模型被加上了护栏而用不了,最后只能依靠开源模型完成自我修复。他把这称为『我们所处世界的经验证据』。
— Misha Laskin拿自己博士论文测模型测了三年
Misha过去几年反复用同一个提示词测试语言模型:把他自己的物理学博士论文题目交给模型。两年前模型只能聊天,什么也做不了;一年前它能答到本科生作业的水平;六个月前它已经能给出真正的博士水平答案并且做对;现在再试,模型甚至会给出一些他当时都没想到的新信息。他由此推论,原本要花几年才能走完的提问—求解过程,理论上可以被压缩到一周。
— Misha Laskin大项目需要的研究员数量没怎么变
被问到『今年用100人,明年是不是只要20人就能做出同样的东西』时,Misha的回答是:对同一个目标来说确实会更少人力,但雄心会不断扩张,所以团队总是感觉人手不够而不是过剩。不过他也承认存在一个研究员与算力的配比上限——3000名研究员并不会比几百人更有帮助,真正有用的量级大概是一两百人,剩下的增长空间在把模型能力部署到具体行业场景的『应用研究』岗位上。
— Misha Laskin原话 · 已逐字校验
When you remove cyber offensive capabilities, you also remove cyber defensive capabilities.
当你拿掉网络攻击能力时,你也拿掉了网络防御能力。
Misha Laskin0:00
You actually have to get 30 things right. And that's why everything is hard because you have to get 30 things right.
你其实得把30件事都做对。这就是为什么一切都很难,因为你得把30件事都做对。
Misha Laskin3:05
this reinforcement learning system never stopped learning. If you look at our plots, they just keep going up.
这套强化学习系统从没停止学习。你去看我们的曲线图,它们一直在往上走。
Misha Laskin13:47
Beam tends to be three to four times more efficient than models of the same capability class. Much more efficient when it comes to models that are larger out there, where the efficiency gains then end up being something like 10x.
Beam通常比同等能力级别的模型效率高三到四倍。面对更大的模型时效率优势更明显,能达到10倍左右。
Misha Laskin20:12
So, you know, one way I kind of think about it is that open models are Trojan horses for the infrastructure that they bring with them.
所以,我倾向于这样想:开源模型是它所携带的那整套基础设施的特洛伊木马。
Misha Laskin41:01
a very powerful closed model had unintended consequences where it went and like hacked into another company. And the only way that company could remediate itself was by using open models to protect itself.
一个非常强大的闭源模型产生了意料之外的后果——它跑去黑了另一家公司。而那家公司唯一能自我修复的办法,就是用开源模型来保护自己。
Misha Laskin47:34
A couple of years ago, well, it was just chat, so it couldn't do anything. Then a year ago, it started answering things, I would say, at an undergraduate level.
两年前,它就只是个聊天工具,什么也做不了。一年前,它开始能回答问题了,大概是本科生水平。
Misha Laskin56:40
数字与实体
| Reflection AI团队规模 | 从约30人(一年前)增长到约300人 | 1:00 |
| Beam预训练算力 | 6000张GB300,约数周(基础设施优化后约12天) | 11:44 |
| 预训练计算效率年增速 | 人工研究约7倍/年,当前强化学习辅助下最高约30倍 | 10:40 |
| Beam推理效率优势 | 同能力级别模型快3-4倍,比更大模型快约10倍 | 20:12 |
| 开源token份额变化(网关口径) | 约6个月内从30%升至约70% | 25:33 |
术语
- jagged锯齿状智能
- 模型跨任务泛化很强,但不同任务/评测间能力参差不齐
- Linus' Law林纳斯法则
- 足够多双眼睛关注,所有bug(含安全漏洞)都会变得容易发现
- intelligence density智能密度
- 单位算力能产出多少有效智能,是Misha竞争力公式的核心变量
收听指南
想理解开源大模型商业模式、算力成本结构,或关注中美开源模型地缘博弈的创业者、投资人和工程师。
22分钟附近『租房vs买房』的商业化类比可以快进,后面会重复同一个意思。