世界太吵,来原声听播客

张小珺·商业访谈录

模型是炼油厂:第一阶段的赢家不是最后的赢家

商业史上第一波跑出来的公司几乎从不是下个阶段的赢家。模型公司是提炼基础油的炼油厂,值钱的是化工厂和汽车公司。

论文精读模型范式Infra多模态AI 历史

原视频在 YouTube 上放不出来,用音频听:

四小时论文串讲,信息密度高但节奏慢,适合当工具书跳听,不适合通勤一口气听完。

核心论点 · 点时间戳可跳到原声

19:35

GPU 的胜利不是远见,是坚持

1999 年 GeForce 256 把三维计算从 CPU 里拆出来,2001 年引入可编程 shader,GPU 才变得可编程。2004 年 Brook for GPU 把底层图像硬件抽象化,做出 CUDA 的前身。关键判断:老黄并不是看见了 AI,2012 年英伟达对 GPU 的设想里基本不包含现代 AI 的东西,ATI 当时也做了类似 CUDA 的东西,只是没坚持住退出了市场。Cuda 早期让显卡游戏性能没提升、BOM 成本几乎翻倍,老黄为此坚持了大约十年才等到科学计算的产出。

— 谢金驰
52:35

ResNet 之前,模型越大反而越差

2015 年人们发现模型堆到 100 层以上不但不会更好,反而更差,这叫模型退化,也就是说今天大家熟知的 scaling 在当时其实不 work。ResNet 引入残差,把学习目标从「把 X 直接变成 Y」改成「在 X 上做多少增减变成 Y」,后者学习难度更低,同时缓解梯度消失和爆炸,几乎消解退化问题。此后才能训练几百层甚至几千层的网络,在此之前通常限制在几十层。这篇论文引用量接近 30 万,比 Transformer 更高。

— 谢金驰
1:12:48

AlphaGo Zero 启发了 thinking 模式

AlphaGo Zero 只用强化学习,不给模型任何人类先验知识,模型只知道围棋的格子和规则,不知道棋谱、气、眼。它比击败李世石的版本用了更少的卡,只训了 36 个小时就取得超越。更深远的影响是它每走一步都执行 1600 次 MCTS 搜索,这启发了 OpenAI 在 test time 做 scaling,也就是 O1 的 thinking 模式。一个反直觉的点:如果模型不做 test time computing,模型能力其实并没有我们想象那么强。

— 谢金驰
1:22:51

COT 把 scaling 重心从预训练转向后训练

过了 2017 年大家拼命 scale 模型,但在算术、常识、符号推理领域收益不明显,不是所有领域都有 scaling law。同时用 SFT 解决推理问题,构建推理数据集成本很高,要请很多博士来做。COT 发现只要向模型展示推导的中间步骤,就能大幅提高推理任务表现,这就是「请你一步一步思考」的来源。它让整个行业意识到很多能力其实已经蕴含在模型里,只是没被激发出来,scaling 重心从预训练转向后训练,也影响了后来 thinking 模型的诞生。

— 谢金驰
1:56:19

OpenAI 和 DeepMind 对 scaling 有分歧

两篇 scaling law 论文发现语言模型训练和 loss 之间存在对数线性关系,可以用小模型实验预测放大后的效果,避免花三个月开盲盒。但两家结论不同:OpenAI 建议在给定计算预算下训尽可能大的模型,即使这意味着提前停止训练;DeepMind 认为这会导致很多模型训练不足,主张模型规模和训练 token 数等比例扩展,参数翻倍数据也翻倍。DeepMind 还证明用更多数据训练更小的模型,比用更少数据训更大的模型更好,因为小模型推理成本低,这就是现在很多小模型用过量数据训练的原因。

— 谢金驰
2:13:24

万卡训练全世界只有三家公司有经验

2020 到 2022 年期间,全世界大概只有三家公司有把一万张卡连起来训练的经验:OpenAI、Google、DeepSeek。DeepSeek 搭萤火虫二号时就是一个很大的集群,用不完,还让大学老师和学生通过学术理由申请使用。把一万张卡连起来当一张卡用,挑战在训练效率和训练稳定性:卡越多不一定越好,弄不好一万张卡的效率还不如一千张;GPU 在万卡尺度上会坏,有物理损坏,也有比特翻转,需要一套深度可观察的系统来监控、诊断、归因、自动定位故障和自动恢复。

— 谢金驰
2:18:28

DeepSeek 贴着 H800 的带宽限制做设计

DeepSeek 的卡是 H800,特点是带宽比较窄。带宽窄的时候做张量并行,模型传不过去,比如带宽只有 80G、要传的模型有 20G,就只能切 4 张卡,想切 5 张就堵住了。他们的并行设计正好贴着 H800 的限制,实现了几乎的计算和通信平衡,计算不需要等通信。现在训练里 MFU 只有 50% 甚至不到,也就是说接近一半的 GPU 算力被空置,理论上如果能做到 100%,就可以少买一半的卡。

— 谢金驰
3:00:00

1.3B 的模型调教后比 175B 更听话

GPT-3 虽然强大但不好用,会生成不真实、有毒、无助于用户的内容,指令遵循能力差,这些问题并没有随着 scaling 改善而改善,从 GPT-1 的 0.1B 放大一万倍也没彻底解决。InstructGPT 用基于人类反馈的强化学习,雇了 40 多个合同工构建 SFT 数据和排序数据,把优劣信号放大一两个量级。结果发现 1.3B 的 GPT-3 经过这种方法调整后,在遵循指令方面比 1750 亿参数的 GPT-3 还要好,参数量缩小了 100 倍。这让行业意识到除了单纯扩大模型,优化后训练方法的提升也非常大。

— 谢金驰

原话 · 已逐字校验

那麦说我们不提供对模型解释 为什么模型work的任何解释 如果它work 那我们把它归为神的仁慈

那麦说,我们不提供对模型为什么 work 的任何解释。如果它 work,那我们把它归为神的仁慈。

谢金驰1:00:42

所以发现一个好问题 核心问题很关键 对而且你会发现 你会发现 如果我们回过头来看 这些好问题 好像没有那么的难

所以发现一个好问题、核心问题很关键。而且你会发现,如果我们回过头来看,这些好问题好像没有那么的难。

谢金驰1:38:04

他说我们从能够智能搞到70年 发现利用计算的通用方法 最终最为有效 且优势显著 他说根本原因在于某个定律 或者说更广义的计算单位成本的 持续指数级下降

他说我们从能够智能搞到 70 年,发现利用计算的通用方法最终最为有效,且优势显著。根本原因在于某个定律,或者说更广义的计算单位成本的持续指数级下降。

谢金驰1:43:08

所以AI研究者 试图将知识编码入其智能体 这在短期内总是有效 且令人的个人满足 它有收益 但长期会陷入平台期 甚至阻碍进展 而突破性的进展 最终来自相反路径 通过搜索 searching和learning 搜索和学习 实现计算规模扩展

所以 AI 研究者试图将知识编码入其智能体,这在短期内总是有效且令人个人满足,它有收益,但长期会陷入平台期甚至阻碍进展。而突破性的进展最终来自相反路径:通过搜索(searching)和学习(learning)实现计算规模扩展。

谢金驰1:46:11

你会发现 如果你不用标签的数据来训练的话 模型会失去对人体结构的理解能力

你会发现,如果你不用标签的数据来训练的话,模型会失去对人体结构的理解能力。

谢金驰2:09:24

数字与实体

AlphaGo Zero 训练时长36 小时1:12:48
AlphaGo Zero 每步 MCTS 搜索次数1600 次1:12:48
ResNet 引用量接近 30 万54:38
GPT-2 参数量15 亿2:54:57
InstructGPT 雇用的合同工数量40 多个3:02:06
LAION-5B 图文对数量5B2:07:24

术语

MFU模型浮点运算利用率
GPU 算力实际被使用的比例,现在通常只有 50% 甚至不到。
MOE混合专家模型
超大参数模型每次推理只激活一小部分参数,降低推理成本。
COT思维链
让模型展示推导的中间步骤,从而大幅提高推理任务表现。
LoRA低秩适配
在模型旁挂一个小矩阵做微调,不改变原模型,推理时可合并。
RLHF基于人类反馈的强化学习
用人类排序数据训练奖励模型,再强化学习调整模型行为。
光流optical flow
相邻帧相减得到的运动影子,包含视频中的运动信息。

收听指南

谁该听

想系统补 AI 论文但不知从何下手的工程师和产品经理,适合当工具书按章节跳听。

可跳过

1:52:58 到 2:21:28 的 Infra 和数据部分,嘉宾自认了解较少,可快进。