世界太吵,来原声听播客

WelchLabsVideo

残差连接:深度学习史上最被低估的简单 hack

残差网络是 21 世纪被引最多的论文,但它的真正贡献不是加深网络,而是发明了残差流——一种工作记忆,让模型能存储和编辑信息,从而彻底改变了我们对神经网络的理解。

残差网络深度学习Transformer工作记忆视觉模型架构
这集用清晰的动画和实验,讲透残差连接为何有效、如何催生 Transformer,以及残差流作为工作记忆的证据。适合想深入理解现代 AI 架构本质的人。

核心论点 · 点时间戳可跳到原声

2:07

深层网络性能反而倒退

2015 年初,孙剑团队用精心初始化把网络加深到 30 层,但性能反而比 14 层差(错误率 16.59% vs 13.34%)。理论上,30 层模型可以通过恒等映射达到至少与 14 层相同的性能,但优化器找不到这种解。这暗示问题不在网络容量,而在训练过程本身。

15:18

梯度破碎是深层网络的病根

通过损失地形可视化,发现随着层数增加,早期层的损失面变得极其崎岖,梯度方向像白噪声一样随机,这被称为「破碎梯度问题」。梯度是学习的核心信号,一旦失效,深层网络就无法有效训练。

17:18

残差连接:一个近乎荒谬的简单解

孙剑团队的解决方案简单到可笑:在每两层之间,把输入张量直接加到输出上,形成跳跃连接。这为激活和梯度提供了直达路径,有效消除了破碎梯度问题。加了跳跃连接的 74 层网络,准确率从 38.9% 飙升到 72.6%,一举横扫 2015 年各大视觉竞赛。

20:19

残差网络颠覆了层级表征理论

康奈尔团队发现,删除甚至打乱 ResNet 的层,对性能影响很小。这与当时主流的层级表征理论相悖——该理论认为每层都构建在前一层之上,删除任何一层都应是灾难性的。这迫使学界重新思考:ResNet 可能不是在学习层级特征,而是在迭代地精炼一个贯穿网络的「残差流」。

26:26

残差流:现代 AI 的隐藏骨干

把跳跃连接拉直,可以看到数据从输入到输出有一条不间断的流,每层只是在其上做增量修改。这个「残差流」后来成为 Transformer 的核心设计,也是现代 AI 的基石。但要注意,后续研究证明 ResNet 既学习层级表征,也精炼残差流,两者可以共存。

29:28

残差流是模型的工作记忆

Meta 团队发现,视觉 Transformer 的残差流中,某些位置的激活值异常大,且集中在图像不重要的区域。他们假设模型把这些位置当作「寄存器」,用来聚合全局信息。实验证实:这些高激活位置的嵌入向量在图像分类上表现惊人(85.2% vs 10.8%),而加入额外的「寄存器 token」后,模型就不再占用图像位置了。

原话 · 已逐字校验

So if the 30 layer model was capable of achieving at least the same performance as the 14 layer model, then why couldn't the team's optimizers find these solutions?

如果 30 层模型至少能达到 14 层模型的性能,那为什么优化器找不到这些解?

as depth increases, gradients in standard feed forward networks increasingly resemble white noise.

随着深度增加,标准前馈网络中的梯度越来越像白噪声。

The solution GNS's team found is almost comically simple.

孙剑团队找到的解决方案简单到近乎滑稽。

Few ideas in the history of machine learning have had such a profound and rapid impact on the field, ultimately earning the ResNet paper more citations than any other paper in the 21st century.

在机器学习史上,很少有想法能产生如此深远而迅速的影响,最终让 ResNet 论文成为 21 世纪被引用最多的论文。

The model learns to recognize patches containing little useful information and recycles the corresponding tokens to aggregate global image information while discarding spatial information.

模型学会识别包含少量有用信息的图像块,并回收相应的 token 来聚合全局图像信息,同时丢弃空间信息。

And it's so remarkable to me that in the absence of registered tokens, these models effectively learn to make their own by repurposing unimportant parts of the image.

令我惊叹的是,在没有寄存器 token 的情况下,这些模型会通过重新利用图像中不重要的部分,有效地自己制造出寄存器。

数字与实体

74 层网络准确率38.9%8:13
8 层网络准确率44.1%6:10
加入残差连接后 74 层网络准确率72.6%19:19
高激活嵌入向量在 Cars 数据集上的准确率85.2%29:28
非高激活嵌入向量在 Cars 数据集上的准确率10.8%29:28

术语

Residual stream残差流
数据在网络中从输入到输出的连续流动路径,每层只做增量修改。
Skip connection跳跃连接
将输入张量直接加到层输出上的操作,为梯度提供捷径。
Register tokens寄存器 token
额外加入的嵌入向量,用于存储全局信息,避免占用图像位置。
Shattered gradients problem破碎梯度问题
深度增加导致梯度像白噪声一样随机,使训练失效。

收听指南

谁该听

深度学习研究者、AI 工程师、对神经网络底层机制好奇的技术爱好者。

可跳过

赞助商 Jane Street 访谈段落(21:20-23:21)可跳过,不影响主线。