原声.
1 篇深读 信源 RSS

世界太吵,来原声听播客

Andrej Karpathy

更新极少,但每条都值得逐帧看

本站已深读1 / 15 集
更新节奏约 8.1 天一集
最新一集2026-08-18
分类AI / 技术
优先级T1
Andrej Karpathy 0716

训练语言模型本质上是在训练一个文本压缩器

交叉熵损失之所以被选中,是因为数学上可以证明它是唯一能保证「模型输出等于数据真实分布时损失最小」的函数形式,而这恰好等价于把模型训练成逼近香农极限的文本压缩器。

8 要点 8 金句 信息论交叉熵