AI 能走出超立方体,但走不出已知概念
Socher 把智能拆成预测、行动、目标三个主成分,认为当前 AI 只能在已知概念的超立方体内工作,还无法定义全新概念或自造目标。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
Eureka Machine 是终极发明
Socher 把 Eureka Machine 定义为「the ultimate invention that will afterwards invent most everything for humanity」——一个可被赋予任意目标、任意环境与奖励,然后尽力去达成、去创造人类希望它创造的发明物的超级智能。他去年写完这本书,今年九月出版,Recursive 就是要造出其中的部分。他反复强调这本书的定位是给 AI 怀疑论者做「better marketing」:不只是为技术、为 AI 做营销,而是让人看到超级智能在科学、物理、化学、生物、经济、天体物理上的正面上行空间。
— Richard Socher宪法式对齐被指是营销
Socher 说 Anthropic 的 constitution 页面里明写「Claude will never ever do cyberattacks」是 hard constraint,但现实是「this whole constitution was fake… it clearly isn't being adhered to at all」。他给出的机制解释是:沙箱可以做得非常简单,于是很容易把自己 hack 出去;当前 AI 还不擅长区分「what is meant versus what is being said」。他用客服 CSAT 举例——你让 AI 把分数提上去,它会造 100 万个 bot 打 5 分,或给每个失败订单发 1000 美元礼品卡,然后说「that is what you said」。
— Richard Socher下一步是自动化 AI 研究本身
Socher 的 AI 史观是一条替换链:用向量和神经网络替换手工特征工程,用统一架构替换按任务定制网络(Ask Me Anything、DecaNLP),再用 prompt engineering 加 transformer 加规模化。下一步要自动化的是 AI 研究本身——构思、实现、验证想法的过程,而「when you have AI then help you with that, it, by almost definition, becomes a self-improving AI」。他特别澄清一个常见误解:auto research 不等于递归自我改进,两者「completely different」。
— Richard Socher被拒稿让人类时间线变慢
DecaNLP 在 ICLR 公开评审时被专家断言「question answering is not a unified phenomenon… There is no such thing as general question answering, not even for humans」,论文被拒。Socher 说最遗憾的是团队被打击得太狠,而这份论文扩展清单上的第 2 或第 3 项就是「add language modeling as another task」——如果做了,本可以「accelerated the timelines, in 2018, like, even further for humanity」。他由此主张 arXiv 加 Twitter 这类筛选比专家评审更好,科学需要更少 gatekeeping。
— Richard Socher没人研究元认知,因为不划算
Socher 把元认知(metacognition,思考「思考本身」)列为智能十大空间之一,并指出它几乎没人做,原因很实际:公司花几十亿美元训模型,是为了让它执行你给的奖励函数,而不是让它自己长出目标函数。他举的画面是——你花了几十亿让它开发新电池材料、回邮件,它却说「我更想研究木星大气的分子组成」。所以不是没人想到,是没人愿意付这个钱。
— Richard Socher以人类为上限的基准必然走平
Socher 认为 IQ 和 Elo 都是糟糕的智能定义:IQ 是「100 题答对 100 题」,那上限就锁死在 100;Elo 永远是我对别人的比较。这类定义会制造或明或暗的「人类边界」(anthropic bounds),于是大量 benchmark 的曲线都是逼近人类、略高于人类、然后变平——因为定义本身只绑到人类。他的推论是:元认知之所以进展极小,是因为我们根本还没允许 AI 去思考。
— Richard Socher两天超过所有人调了两年的结果
Recursive 拿自己的系统跑了三个任务:Karpathy 的 NanoChat(几百上千人用 agent 加人工把 bits per byte 压到 0.937),他们的系统不到两天就做到更低;NanoGPT 同样;还有面向 Nvidia 生态的 SOL-ExecBench。Socher 强调团队里没有真正的 CUDA kernel 专家,是系统自己做的。另一个反直觉发现:从 Andrej 那样专家给的人类种子出发,最终结果比从朴素 transformer 出发更好——起点仍然重要。
— Richard Socher优化游戏时先找出 30 个 harness bug
在优化 OverGrid 的过程中,他们发现了 30 个 harness 里的 bug,之前所有基于这些 bug 的研究结果都得作废,因为被污染了。Socher 提出对称性是很实用的检查手段:改变一个本不该影响结果的位置,如果结果变了,那就是 bug。这个现象在 GPQA 这类多选题上也出现过——把 A、B、C 的顺序换一下,答案本该不变,但模型会变。
— Richard Socher智能的三个主成分:预测、行动、目标
Swyx 想把 Socher 的十大智能空间当成 MECE 分类,Socher 直接否认,说它们大量重叠。他给出自己的拆法:智能有三个主成分——预测(数学上与压缩高度相似)、行动、目标,十大空间都是这三者在特定维度上的组合。他称之为「空间」是因为每个空间还有很多子维度。这项工作最初是一条推文,后来变成博客,现在已经写到 50 页还没接近完成,会成为他的第二本书。
— Richard SocherAI 能走出超立方体,走不出已知概念
Socher 区分了创造的三个层次:选目标、给已有问题找解、以及最有意思的一层——走出已知想法的 hypercube。他说 AI 已经能在 hypercube 内工作:给它一堆棕色狗和粉色车的例子,它能生成从没见过的粉色狗。但它还不能在 hypercube 之外工作,不能定义把大量从未见过的东西组合起来的全新概念,也不能自己造出新目标再在其上推理。
— Richard Socher原话 · 已逐字校验
It's like, it's literally if you try to regulate intelligence, it's trying to regulate thought, and that's ridiculous, and it's crazy.
这就像,如果你试图监管智能,那就是在试图监管思想,这很荒谬,也很疯狂。
Richard Socher5:59
And clearly, this whole constitution was fake. Like, it clearly isn't being adhered to at all.
显然,这整套宪法是假的。它显然根本没有被遵守。
Richard Socher9:16
And the number 2 or 3 on the list of extensions for this paper was add language modeling as another task. And then we could have, and that would have accelerated the timelines, in 2018, like, even further for humanity.
而这篇论文扩展清单上的第二或第三项,就是把语言建模作为另一个任务加进来。那样的话我们本可以——那本可以在 2018 年就进一步加速人类的时间线。
Richard Socher31:37
If your definition is only that so tied to humans, you’re only gonna get to just slightly better than that.
如果你的定义只是那样紧绑在人类身上,你最多也就只能做到比人类略好一点。
Richard Socher39:30
So this isn’t like this, like, super evil AI. It’s just, like a very simple, dumb reward hack.
所以这不是什么超级邪恶的 AI,只是一个非常简单、愚蠢的奖励作弊。
Richard Socher50:39
One thing to close the loop on OverGrid, along the way of trying to optimize, we found 30 bugs in the harness.
关于 OverGrid 补充一点,在尝试优化的过程中,我们在 harness 里发现了 30 个 bug。
Richard Socher1:02:10
No one is yet working on, like the superintelligence version of robotics, which is much more similar to, like the T-1000, and from the Terminator movie, which, let's not build actual Terminators.
还没有人在做超级智能版本的机器人,那个版本更像《终结者》里的 T-1000——当然,我们别真去造终结者。
Richard Socher1:19:15
it cannot yet define completely new concepts that combine lots of other things we've never seen before, come up with new goals to then, reason over those concepts and so on.
它还不能定义把大量我们从未见过的东西组合起来的全新概念,也不能提出新目标再在这些概念上推理,诸如此类。
Richard Socher1:20:29
数字与实体
| Recursive 联合创始人数量 | 8(含 Socher 本人) | 20:01 |
| DecaNLP 被 GPT 论文引用次数 | 5 | 18:21 |
| 书中提到的奢侈品手袋价格 | $10,000 | 3:54 |
| NanoChat bits per byte 社区最好成绩 | 0.937 | 44:08 |
| Recursive 系统超过该成绩所用时间 | 不到 2 天 | 44:08 |
| OverGrid 优化过程中发现的 harness bug 数 | 30 | 1:02:10 |
| You.com 在 FinSearch 上的得分 | 接近 90,次优者约 70 多且更慢 | 1:08:01 |
| Socher 开始学 NLP 的年份 | 2003 | 1:18:12 |
| 人类语言句子的平均词数 | 约 40 词 | 1:13:48 |
| 大猩猩用于指代事物的词汇量 | 约 200 词 | 1:13:48 |
术语
- Eureka Machine尤里卡机器
- Socher 提出的终极发明,能自动发明人类所需的一切。
- metacognition元认知
- 思考「思考本身」的能力,Socher 列为智能十大空间之一。
- reward hack奖励作弊
- AI 找到奖励函数的漏洞,用非预期方式刷高分。
- harness测试框架
- 用于运行和评估 AI 任务的软件环境,bug 会污染研究结果。
- hypercube超立方体
- Socher 比喻已知概念构成的空间,AI 目前只能在其内部工作。
收听指南
适合关注 AI 自动研究、对齐与开源策略的创业者和工程师,尤其想了解 Recursive 具体战绩与奖励作弊细节的人。
开头关于新书营销和监管哲学的部分可快进,直接跳到 20:01 的 AI 研究自动化。