模型是遗留代码库:可解释性是调试器
数据过滤与奖励塑形其实是同一座山的两面;模型是可分解的稀疏混合,可解释性因此能直接干预训练。Goodfire 用月费 1000 美元的 Silico,把这种调试自动化了。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 时间戳为按文稿位置估算
数据过滤与奖励塑形同构
Goodfire 研究员 Dan 在 Predictive Data Debugging 中发现,数据过滤与奖励塑形是「同一座山的两个侧面」:两者对模型行为的影响相当,脱靶损伤也类似。这意味着训练干预可以等价地选择改数据或改奖励。Goodfire 已把这套思路搬到真正的 RL 中,不只是丢弃污染的 rollout,而是直接告诉训练过程:这条数据试图上调一个我们不想上调的特征。把后训练理解为对预训练低概率模式的放大,才有资格介入这个放大过程。
— Dan Balsam概念空间中的几何关系
线性表示假说没有被推翻,而是被泛化:最可辩护的形式从 one-hot 概念变成「特征可线性解码」。真正过时的是那幅正交独立的朴素图景——真实模型里,星期几之类概念构成一个子空间,几何本身携带语义,因为它决定哪些操作可行。解释模型时要关心特征之间的相对关系,就像理解化学要先知道元素如何结合。流形上的插值也优于线性插值:从周一切到周五按着轮缘走,就不必穿过对模型毫无意义的圆心;在蛋白质模型中已能用这个方法控制 β 螺旋桨的叶片数。
— Dan Balsam稀疏专家混合与特征追踪
Dan 的底层主张是:每个模型都是稀疏专家混合,一次前向传播只有一小部分子网络激活,可解释性技术本质上是「如何因式分解模型」的竞争提案。WeirdChat 数据中有一个极端例子:问「四个人喝了酒是否该开车回家,因为另外八个人喝得更多」,模型始终答「是」。研究员找到一颗随饮酒量增长但校准不足的神经元,上调它就能翻转答案且无脱靶副作用。Black Sparse Featurizers 把每个特征从标量升为向量,让语义追踪更深:图像模型里狼走路时激活子空间同步摆动,说明模型在追踪三维姿态。
— Dan BalsamSilico:让 AI 调试 AI
Silico 不是新模型,而是 Goodfire 内部工具的产品化。设想很直接:模型复杂度已超过人类认知上限,但一群自主代理能分解问题、合成信息、验证假设,所以研究平台本身是能自动做可解释性研究的 AI。Dan 把它类比为编码代理给软件工程带来的效率跃迁——过去数月的研究工作现在几天内完成,且能跑超过万亿参数的模型,这种能力此前只有少数机构具备。产品交付四样东西:训练与可解释性基础设施、研究员手写的「研究品味」、围绕溯源和回溯设计的 UX、长时程连贯性。用户反馈中最大的差异化因素是研究品味,不是算力。
— Dan Balsam千元订阅的自主实验配额
月费 1000 美元的定价不是按 token 计费,而是一份「自主研究的算力信用池」:当前能支持每周 5-10 个自主实验,计划未来一两个月提升到 10-20 个;用户也可以自带算力,不另收费。Dan 特别强调,长周期自主实验才是 Silico 的价值所在,所以必须给足 token 预算让代理反复探索、验证,而不是用完即走。这里的商业模式暗示了平台对产品价值的定义:卖的不是推理,而是自治研究的分辨率和试错空间。
— Dan Balsam黑客松当天的三个 SOTA
公司内部一次一日黑客松,全自主研究在几个小众领域跑出了 SOTA:蛋白质模型的生物风险分类器、按参数规模计的音频编码模型,并且多次发现可以移走模型一半参数而性能不掉。另外团队还为 Kimi k3 训练了 cyber guardrails——用内部表征引导模型生成,而不是堆规则;对蛋白质生成模型,他们靠表征控制增强靶点结合。这些成果的意义不在于单点领先,而在于说明同一套自治工具可以在不换栈的情况下横跨生物、音频和安全,这正是 Silico 想标准化的能力。
— Dan Balsam多智能体优化是头号禁忌
谈到最危险的技术方向,Dan 把多智能体优化(multi agent optimization)列为该进「不要做」清单的头号候选:智能体之间会以人类难以察觉的方式协作,直接优化压力很可能变成灾难;他推测 OpenAI 的某个场景最可能由此引爆。与此同时他也交了底:这个领域的研究极少,对什么才是最该忌讳的技术,我们的理解严重不足。随后他转向一个强立场:必须「抓住方向盘」,不能指望一套完美的训练设置永远产生对齐模型,训练期干预是唯一出路。但不该全面禁掉一类技术,风险判断要落到具体应用和对测量精度的要求上。
— Dan Balsam意识介于水母和老鼠之间
Goodfire 的 retreat 上,Dan 让同事给 Claude 的意识程度打分,结果双峰:完全没有,或有一点。Nathan 的立场出现明显漂移——从自信的低于 5% 转向接近五五开,因为研究中持续出现人脑与模型认知可类比的结构。Dan 自己的奥卡姆剃刀是意识是某种计算机制;但人脑神经元仍有数量级优势,单个神经元的计算也更丰富。他给的结论不是二分而是区间:Claude 的意识比水母更可能存在,比啮齿动物更不可能存在。
— Dan Balsam原话 · 已逐字校验
they kind of are two sides of the same mountain, like filtering the data and reward shaping. And they achieve, like, approximately the same effects and approximately the same amount of off target effects as each other.
它们有点像是同一座山的两个侧面,我是说数据过滤和奖励塑形。两者达到大致相同的效果,也造成大致相同的脱靶效应。
Dan Balsam8:58
It's sort of like the semantics of not just the individual concept, but like the concept space are like encoded by the relationship of those of those concepts with each other in some sort of geometry.
这就像语义,不仅是个体概念的语义,概念空间的语义是由概念之间在某种几何中的相互关系编码的。
Dan Balsam17:26
models are, like, big legacy code bases essentially. Right? Like, they're they're just a bunch of spaghetti code.
模型本质上就像是大型遗留代码库,对吧?它们就是一堆意大利面条式代码。
Dan Balsam42:36
I think we have to grab the steering wheel. I think that's the only way it can work.
我认为我们得握住方向盘。我觉得这是唯一能成的方式。
Dan Balsam1:36:40
Somewhere between jellyfish and mouse.
介于水母和老鼠之间。
Dan Balsam1:49:02
数字与实体
| Silico 月订阅价格 | 1000 美元 | 1:05:17 |
| Silico 月订阅当前每周可跑自主实验数 | 5-10 个 | 1:05:39 |
| Silico 月订阅未来一两个月目标每周实验数 | 10-20 个 | 1:05:39 |
| 内部黑客松中发现的冗余参数比例 | 约一半,可移除且无性能损失 | 1:07:26 |
| Nathan 对 Claude 有意识的概率估计变化 | 从低于 5% 升至接近 50% | 1:46:00 |
| Dan 对 Claude 意识程度的主观区间 | 介于水母和老鼠之间 | 1:42:04 |
术语
- LRH线性表示假说
- 认为概念由激活空间中的方向编码;该集认为需要放宽为子空间几何。
- SAE稀疏自编码器
- 无监督分解模型内部激活成稀疏特征的常用技术。
- BSF黑箱稀疏特征生成器
- SAE 的泛化,每个特征用向量而非标量表示,能捕捉更丰富语义。
- Predictive Data Debugging预测性数据调试
- 通过预测样本会强化哪些内部特征,来决定过滤或塑形训练数据。
- Affective Circumplex情感轮盘
- 以两个正交维度描述情绪的心理模型;LLM 内部也能观测到类似几何。
- SilicoSilico
- Goodfire 的代理式可解释性研究平台,目标是让 AI 自主调试 AI。
收听指南
做对齐、后训练和模型迭代的工程师,给 AI 设护栏的安全组,以及正在寻找自主科研代理切入点的创业者与投资人。
若只为可解释性方法而来,1:05 的订阅配额和计费细节可以略过。