世界太吵,来原声听播客

张小珺·商业访谈录

AI 只是刚离地的莱特飞机,我们还不会控制它

深度学习奠基人谢诺夫斯基说,大模型缺的不是语言而是基底核——没有价值函数、没有长期记忆、没有情绪,而这些脑区都能补上;真正的风险不是规模,而是没人知道它会长出什么。

深度学习大模型认知科学AI 监管脑科学
前半段是深度学习史的一手回忆(玻尔兹曼机、明斯基、乔姆斯基),后半段是对大模型缺什么的机制判断,信息密度高但需要一点耐心。

核心论点 · 点时间戳可跳到原声

5:10

玻尔兹曼机是明斯基错了的存在性证明

明斯基和 Papert 在感知机那本书里证明了单层感知机的局限,并在结尾断言没人能把学习规则推广到多层。谢诺夫斯基和 Hinton 的做法是把单元从确定性的 0/1 改成概率性、会波动的单元,于是玻尔兹曼机成了「明斯基和 Papert 错了」的存在性证明。它和反向传播的关键差别是全部局部:不需要回传误差,只要在输入存在和输入撤走两种条件下分别算输入与输出的相关性再相减,他们把撤走输入那一相叫 sleep phase。代价是要等整个网络达到平衡、算出平均相关性,算力消耗远大于反向传播。

— Terrence Sejnowski
8:10

玻尔兹曼机要求整个网络全局相干

谢诺夫斯基用物理学的相变来解释玻尔兹曼机的限制:层数越多,输入往上走、再往下走,整个网络必须变成一个单一协调的状态,他称之为 coherence,就像水变蒸汽的临界点附近整个系统变得相干。这既是它的优雅之处,也是它慢的原因——必须逐层把这种相干性建起来。他同时强调,玻尔兹曼机在 80 年代就已经是多隐层的深度网络,只是当时不叫这个名字,而且它既能做监督学习,也能学输入的概率分布,不只是学一个分类映射。

— Terrence Sejnowski
17:20

明斯基的乒乓球机器人没申请视觉预算

谢诺夫斯基讲了一个他当面跟明斯基核实过的故事:AI 实验室拿到的第一笔 DARPA 经费是造一个会打乒乓球的机器人,拿到钱之后才发现没有申请写视觉程序的经费,于是把它派给了一个研究生做暑期项目。50 周年纪念会上他问明斯基这是不是真的,明斯基纠正他说:不是研究生,是本科生。谢诺夫斯基由此推出符号主义的根本问题:问题越大,程序就越长,写程序极其昂贵且不 scale,就算给几十亿美元写几十亿行代码也解决不了。

— Terrence Sejnowski
23:24

莱特兄弟学的是滑翔,不是扇翅膀

谢诺夫斯基用莱特兄弟反驳「看鸟学不会造飞机」:他们观察的不是扇翅膀,而是鸟不扇翅膀时的滑翔,还自己建了风洞设计机翼。他们学的是原理不是细节——羽毛是轻而表面积大的材料,于是他们用木头做骨架、蒙上帆布,得到同样的高表面积和轻重量。Kitty Hawk 上只飞起来十几二十英尺、飞了半英里左右,但那是原理验证。他认为最难的问题其实是控制,后来靠机翼襟翼解决,而鸟转弯时正是扭动翅膀。

— Terrence Sejnowski
28:27

光速有限,是超算和大脑共同的约束

谢诺夫斯基去德州参观超算中心,对方说最难的地方是光速不是无限的——一纳秒大约走一英尺,而一纳秒正是千兆赫兹的时钟周期,所以核心之间连线的时延变得至关重要。他指出大自然面对的是同一个问题:神经元之间有传导延迟,而大自然已经解决了它。这正是他现在在做的工作——搞清自然怎么解决延迟,再把它用到大规模并行架构的设计里,继续往上 scale。

— Terrence Sejnowski
33:40

他当众问明斯基:你是魔鬼吗

在 50 周年纪念会的晚宴上,谢诺夫斯基举手问明斯基:神经网络社区有人认为你是魔鬼,因为你让进展停滞了几十年,你是魔鬼吗。他说自己生气的不是明斯基的观点,而是他对学生的态度——明斯基最后站起来对学生们说 shame on you,说他们做应用是失败,不做通用人工智能。谢诺夫斯基认为这是滥用学生、伤害学生。明斯基被问到后开始大谈复杂性和计算的本质,谢诺夫斯基打断他说我问的是是非题,明斯基最后说 yes, I'm the devil。

— Terrence Sejnowski
37:57

自监督让训练数据变成半无限

谢诺夫斯基认为生成模型真正的突破是自监督:以前做物体识别要人工标注图片,成本高且受限,网络越大就需要越多数据,数据量反过来限制了网络规模。自监督什么都不用标,只要训练它预测句子里的下一个词,就能把各处所有句子都喂进去,训练数据变成 semi-infinite,规模限制消失。他承认还有很多重要的技术细节,但这一条是让他意外的那条——没人预料到大模型会具备这些能力,最让他吃惊的是它们的英语语法完美到不像人类。

— Terrence Sejnowski
45:08

大模型缺的是基底核,不是语言

谢诺夫斯基说他正在写一本关于新语言模型的书,里面有一个他认为别人没看懂的点:不能怪 GPT-3,它没有父母。人脑里负责强化学习的是皮层之下的基底核,它学习达成目标的动作序列,需要世界反馈什么是好什么是坏,AlphaGo 正是深度学习网络加一个给所有局面赋值的强化学习引擎两部分。大模型没有价值函数,这是缺失的一环。他还说情绪比语言更容易装进去,长期记忆也一样——只要模拟海马体,而大脑里这样的部件有上百个,现在的大模型只有皮层那一部分。

— Terrence Sejnowski

原话 · 已逐字校验

it proved that Minsky and Papert were wrong

它证明了明斯基和 Papert 是错的。

Terrence Sejnowski5:10

as the problem gets bigger and bigger if you try to solve it with writing a computer program the program gets bigger and bigger and that's very labor intensive

问题越来越大,如果你想靠写程序解决它,程序就会越来越大,而这是极其劳动密集的。

Terrence Sejnowski18:20

i thought i was angry not because of what he said but the way he said it to his students

我想我生气不是因为他说的内容,而是他对他学生说话的方式。

Terrence Sejnowski33:40

the only thing we can be absolutely sure of is that it's not human it's not human it's an alien

我们唯一能百分之百确定的是:它不是人,它不是人,它是一个异类。

Terrence Sejnowski43:01

You can't blame GB3. They didn't have parents.

你不能怪 GPT-3。它没有父母。

Terrence Sejnowski45:08

what you should be capping is a capability not the size

你该设上限的是能力,不是规模。

Terrence Sejnowski53:23

the most important things that will come out of it are ones that we can't even imagine that we don't even know about yet

它带来的最重要的东西,是我们现在根本无法想象、甚至还不知道存在的那些。

Terrence Sejnowski1:00:38

if anybody tells you that oh it can't do general artificial intelligence right well just wait for tomorrow it's a moving target

如果有人告诉你它做不了通用人工智能,那就等明天再说,这是一个移动的靶子。

Terrence Sejnowski1:01:43

数字与实体

人脑连接/参数数量级10 的 14 到 15 次方,比当前模型多约一千倍12:12
当前模型参数量级最高约一万亿(a trillion)11:12
AlexNet 在 ImageNet 上降低的错误率20%13:16
灵长类视觉皮层的处理层级约 12 层13:16
NeurIPS 会议规模线下约 16000 人,线上约 3000 人,合计约 19000 人50:12
训练一个大模型的成本数千万美元、数月机时56:28
光速对应的时延一纳秒约走一英尺28:27

术语

Boltzmann machine玻尔兹曼机
把单元改为概率性、会波动的多层网络,用局部相关性学习,是深度网络的前身。
self-supervision自监督
不需要人工标注,用数据本身构造训练目标,如预测句子中的下一个词。
basal ganglia基底核
皮层之下负责强化学习的脑区,学习达成目标的动作序列,需要外部反馈。
hippocampus海马体
负责长期记忆形成的脑区,大模型目前没有对应部件。
stochastic parrots随机鹦鹉
批评者给大模型起的贬称,指其只是复述统计规律而不理解语义。

收听指南

谁该听

做模型和 AI 产品的工程师、关注 AI 长期判断的投资人,以及想补深度学习早期一手历史的人。

可跳过

开头关于他个人求学经历和物理背景的部分可以快进。