AI 权力集中只是当下技术的结果,不是终局
Transformer 靠海量数据和算力才聪明,所以权力集中在买得起数据中心的大公司手里;但 Transformer 还不到十年,人类大脑就是小数据专家的存在证明。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
集中是当前技术路线的属性
Lucas Kaiser 把 AI 权力集中归因于技术现状而非 AI 本质:Transformer 只有在喂进整个互联网数据时才「reasonably smart」,一旦只让它学某个小领域,它就「just stupid」。所以大公司能做的事不是等研究突破,而是 go bigger, bigger, bigger——更大要花数十亿美元,要从互联网每个角落抓数据。这条路径天然集中。但他强调要记住这只是 current state,Transformer 还不到十年。
— Lucas Kaiser没有研究突破时,只能靠堆规模
Kaiser 区分了两条路:一条是等研究突破,让模型用更少数据变聪明;另一条是不等突破,直接堆规模。问题在于研究突破「sometimes they come, sometimes they don't」,它不是商业提案,没法排进路线图。而堆规模是可以立刻执行的,代价是数十亿美元和全网数据抓取。这个不对称——可执行的那条路恰好最集中——才是当前格局的机制,而不是大公司刻意垄断。
— Lucas Kaiser人类就是小数据专家的存在证明
被问到是否存在让更小玩家竞争的算法突破时,Kaiser 的回答是「we know it exists. We are the proof」:人类不是什么都懂的通才,但在各自领域里,专家有时比超大规模模型更强。所以这种能力在技术上一定可实现,只是还没找到怎么做。他甚至猜测答案里可能仍有 attention layer,因为决定效果的不只是模型架构,还有 loss、数据、训练方式,变量太多,不知道具体该往哪看。
— Lucas KaiserOpenAI 从研究实验室变成了产品公司
Kaiser 观察到实验室的研究专注度在下降:他加入时的 OpenAI 是一个纯粹的研究实验室,现在「it's a research lab a bit」,但同时是一家要做产品的大公司。他把这视为开源运动和学术界的机会窗口——大公司分心做产品,研究空间就留给了大学和独立研究者。他自己最近也开始独立做研究。
— Lucas Kaiser一张消费级显卡超过当年八卡机
Kaiser 买了一张 5090 RTX GPU,算力超过当年他们团队用来做 Transformer 研究的八卡机器。他的结论很具体:你训练不了大 LLM,但你可以做研究和实验,而且他认为很多人都应该这么做。这是全篇最硬的一个对比——当年需要团队和机房才能做的研究,现在一个人一张卡就能起步。
— Lucas Kaiser最优解可能是很多个分布式模型
Kaiser 的乐观来自一个类比:人类是世界上最惊人的计算机,大脑仍未被模型超越,而人类不是通才,也不存在「一个巨大的人类大脑」。他由此推测,给定固定数据量,最好的学习方式可能是拥有大量分布式模型——各自独立时很强,联合起来更强。他提到 ensemble 相关的基础研究里有支持这一点的理由。
— Lucas Kaiser数据变贵会把研究拉回基本面
Kaiser 指出机器学习研究并没有在 2017 年停止。因为 Transformer 太好用,所有人都聚焦在大数据路线上;但现在这条路变得如此昂贵,可能反而会把注意力推回更基础的研究。他的判断是:我们知道存在一个更好的算法,能从更小的数据里学习并在所学领域表现出色,只是还没在计算机上找到怎么做,但会找到。
— Lucas Kaiser未来每个人有自己的模型和笑点
Kaiser 描绘的终局很具体:每个人可以拥有自己的模型,从更小的数据里学习,像人一样成为不同领域的专家,甚至「一个用这种方式讲笑话,另一个用另一种方式」。他吐槽现在问大语言模型讲笑话,答案永远一样,总是关于原子之类的。他把这归为技术阶段的产物——当研究跟上,技术就会变。
— Lucas Kaiser原话 · 已逐字校验
the current state of the technology is a bit concentrating, but we should remember that it's just the current state. Sure, transformers are great, but they're not even 10 years old.
当前的技术状态确实有点集中,但我们要记住,这只是当前状态。Transformer 确实很棒,但它们还不到十年。
Lucas Kaiser1:00
But the big companies are like, okay, but you can do things without research breakthrough, which is to go bigger, bigger, bigger. Now that is very concentrating.
但大公司的想法是:好吧,你不靠研究突破也能做事,那就是越做越大、越大、越大。而这就非常集中。
Lucas Kaiser1:00
Like transformers are really good if you train them on the whole internet and then they're reasonably smart. But if you try to say, you know, you just learn about this, then they're just stupid, right?
Transformer 只有在用整个互联网训练时才真的很好,然后它们还算聪明。但如果你说,你只学这个领域,那它们就是蠢的,对吧?
Lucas Kaiser2:00
Well, I mean, we know it exists. We are the proof, right? Humans are not experts in everything.
嗯,我的意思是,我们知道它存在。我们就是证明,对吧?人类并不是什么都懂。
Lucas Kaiser2:00
So I bought a 5090 RTX GPU. It has more power than the eight GPU machines we used as a team to do the Transformers research.
所以我买了一张 5090 RTX GPU。它的算力超过我们当年作为一个团队做 Transformer 研究时用的八卡机器。
Lucas Kaiser3:00
If you look at the world, humans are the most amazing computers in the world, right? Our brains are still unmatched by the models. And we are not generalists.
如果你看看这个世界,人类是世界上最惊人的计算机,对吧?我们的大脑仍然没有被模型超越。而我们并不是通才。
Lucas Kaiser4:02
So, yes, transformers are great when you feed them all of the Internet, but we know there is an algorithm that's even better, and it can learn from much smaller data and be amazing at the things it's learning. We are the proof.
所以,是的,当你把整个互联网喂给 Transformer 时它们很棒,但我们知道存在一个更好的算法,它能从小得多的数据里学习,并在所学的东西上表现出色。我们就是证明。
Lucas Kaiser5:02
It's a step in the technology, but it's a step towards something much more fun where everyone can have their own model, maybe.
这是技术中的一步,但它是迈向某个有趣得多的东西的一步——也许每个人都能拥有自己的模型。
Lucas Kaiser6:02
数字与实体
| Kaiser 自购 GPU 型号 | 5090 RTX | 3:00 |
| 当年做 Transformer 研究用的机器 | 8 张 GPU | 3:00 |
| Transformer 论文发表年份 | 2017 年 | 5:02 |
术语
- Attention is All You Need《注意力就是你所需要的一切》
- 2017 年提出 Transformer 架构的论文,Kaiser 是共同作者。
- ensemble集成
- 把多个模型组合起来获得更强效果的方法。
收听指南
关注开源模型、算力成本与 AI 权力格局的创业者和投资人;想判断「集中是否必然」的人。
结尾的订阅与免责声明部分(约 7:05 之后)可跳过。