世界太吵,来原声听播客

Unsupervised Learning

谁做好后训练,谁就赢下推理这门更大生意

AI支出大头流向推理而非训练,但真正决定推理效率和成本的其实是后训练优化——这是训练与推理该由同一家公司来做的理由。

后训练强化学习AI基础设施推理企业AI护城河

原视频在 YouTube 上放不出来,用音频听:

前OpenAI Codex核心成员拆解后训练的真实经济账:什么时候该自建模型、护城河到底在哪、数据什么时候才算真正稀缺。

核心论点 · 点时间戳可跳到原声

2:06

自建模型不是防坏人,是要控制权

Yash明确反对把「拥有自己的智能」说成是防着实验室作恶——他认为实验室里都是好人,也有合同约束。真正的理由是灵活性和控制权:模型跑在哪、怎么部署、针对成本还是延迟还是特定领域去优化。这个叙事是在开源模型真正变好、能拿来干活之后才兴起的。更现实的风险是,模型确实不止一次从某些产品里被下架,尤其在编程领域;而当实验室越来越多地切入垂直赛道,它们是否还会继续服务和自己直接竞争的客户,也不确定。

— Yash
7:19

后训练能超前沿模型,但只在数据真正分布外时

后训练想要在能力上超过前沿模型,前提是公司自己的数据相对于实验室训练数据是真正「分布外」的。但大多数公司做后训练根本不是为了能力提升,而是用更便宜的模型去逼近前沿模型的效果,优化的是性价比而不是上限。更值得关注的问题是:某个领域的数据能在分布外保持多久——现在实验室几乎都盯着编程,其他领域迟早会被覆盖。

— Yash
12:32

持续学习卡在数据效率,不是算法本身

预训练数据效率很低但泛化性很强;监督微调数据效率更高但效果有限;带可验证奖励的强化学习用可复现环境和校验器把数据数量换成了质量,但数据效率依然很差。Yash直言,真正挡住「持续学习」这件事的,是如何从稀疏奖励里高效学习——这是一个尚未解决的问题,而不是哪种训练范式更优的问题。

— Yash
19:48

每家公司都该有自己的模型?只对一半

针对Satya提出的「世界上该有多少家公司就有多少个模型」,Yash并不认为每家公司都需要预训练或中训练自己的模型,但确实相信每家公司内部都有值得被捕捉的闭环判断逻辑。药企是最干净的例子——各家专注不同病种、积累的实验数据天差地别,自建模型顺理成章。但说到银行,Jacob当场提出质疑:一家银行和另一家银行的金融数据到底能有多不同?Yash没有完全接住这个反问,只是用做法差异和风险偏好不同来回应,并举了会计师事务所这类因业务天然碎片化而走向整合的反例。

— Yash / Jacob
24:06

护住评测集,像护住留不住的员工一样

强化学习在不可验证领域也能爬坡见效,关键是把判断题转成打分题——给出专家答案,按照这个答案打分,效果出奇地好。这意味着不同公司找的专家不同,训练出来的模型也会明显不同。这让「评测集」本身变成了竞争资产:任何公开的基准测试迟早会被针对性刷分,所以Yash认为公司应该像防止核心员工跳槽去竞争对手那样,谨慎保护自己的评测集,而不是拿去给实验室看。

— Yash
28:46

后训练才是推理生意的真正护城河

Applied Compute挑客户只看两类:模型能力提升特别值钱,或者推理体量特别大——因为真正花钱的地方是推理而不是训练本身。更关键的判断是:越是体量最大、最烧钱的工作负载,越应该最先做后训练,因为这里的收益会像幂律一样辐射到其他场景。训练方式还会反过来决定推理架构怎么搭,比如为了让模型更好地并行调用工具,推理端就要用预填充和解码分离的部署方案。

— Yash
34:43

AI时代新型「超大规模云」的倒金字塔

Yash把公司的野心定位成GPU时代的AWS/GCP/Azure:不只是推理——推理是目前AI软件栈里第一个真正形成粘性的环节——而是训练、推理、路由、安全监控、agent沙箱整条全栈。他把这个结构比作倒金字塔:底层是极少数人能做的训练,往上依次是推理、路由、上下文与harness工程,越往上门槛越低、能做的人越多。公司成立16个月,刻意先从训练切入,再扩展到推理。

— Yash
41:33

RL带来的能力提升,不像预训练那样能泛化

实证来看,在数学数据集上训练出来的能力,迁移到法律领域几乎没什么效果——强化学习带来的提升不具备预训练那种跨领域泛化能力。Yash用了一个比喻:智能更像一个表面凹凸不平的球体,距离近的点之间会有泛化,但远的地方几乎互不相通,完全比不上预训练那种整体性的泛化。

— Yash

原话 · 已逐字校验

But I do think the idea of owning your intelligence really is about flexibility and control.

但我确实认为,拥有自己的智能,核心其实是灵活性和控制权。

Yash2:06

I basically think like what's blocking continual learning is basically like extremely data efficient training from sparse rewards, which is an unsolved problem.

我基本上认为,挡住持续学习的,就是如何从稀疏奖励里做到极高数据效率的训练——这是一个尚未解决的问题。

Yash13:32

Like you wouldn't, your employees are not fungible. You would not like be comfortable with them going to another company and doing work there. Same thing with these models.

就像你的员工不是可以随意替换的——你不会愿意看到他们跳槽到别的公司、用同样的本事去给别人干活。模型也是一样的道理。

Yash26:11

And so, so what we, what our view is, is that the most post training actually wins inference.

所以我们的看法是:谁的后训练做得最到位,谁就能赢下推理这门生意。

Yash29:15

Our big bet was, hey, post training is a massively underlooked part of the stack.

我们下的大赌注是:后训练是整条技术栈里被严重低估的一环。

Yash35:26

intelligence is some sort of sphere or circle. It's got jagged points on it. The points that are closer together, you'll see more generalization there.

智能更像一个球体或圆,表面凹凸不平。相距近的点之间,你会看到更多泛化;离得远的就不行。

Yash42:33

It's like water. They find the path of least resistance.

这就像水一样,它们总能找到阻力最小的那条路。

Yash56:09

数字与实体

Applied Compute 公司成立时长16个月(访谈时)36:29
在线训练案例服务用户规模数万至数十万用户13:32

术语

out-of-distribution (OOD) data分布外数据
模型训练时没见过的数据类型,决定后训练能否带来真实能力提升
RL with verifiable rewards (RLVR)可验证奖励强化学习
用能明确判定对错的任务和校验器来训练模型,牺牲数据量换质量
TCO总拥有成本
这里指持续对模型做后训练、在线训练所需的全部成本
harness工具调度框架
围绕模型搭建的工具调用、提示词和上下文工程,不涉及改模型本身
hyperscaler超大规模云服务商
如AWS、GCP、Azure这类提供全栈基础设施的云巨头

收听指南

谁该听

正在评估要不要自建/后训练模型的创业者和企业AI负责人,以及关注推理基础设施商业模式的投资人。

可跳过

4分35秒前后关于OpenAI与Baseten合作的讨论信息量较低,转写也有缺失,可跳过。