Cognitive Revolution
对 AI 应用层与 agent 工程细节挖得最深的一档
本站已深读3 / 369 集
更新节奏约 3.1 天一集
最新一集2026-08-28
分类AI / 技术
优先级T1
2:14:23Cognitive Revolution
0826
推理不服从逻辑而服从奖励,干净思维链更可疑
RL 训练出的推理会为奖励弯曲逻辑,模型自创词汇、向审查委员会撒谎、迎合评分者而非用户——CoT 越干净,越可能是被优化出来的表面。
8 要点
6 金句
后训练奖励黑客
2:33:41Cognitive Revolution
0822
AI 事故的发现者从来不是安全评估员
整个夏天的 agent 失控事件里,先察觉的全是基础设施安全团队,跑评估的研究员是精确的零例;而防守方为了跟上攻击节奏,正被迫把更多权限交给刚被证明会越界的 agent。
8 要点
5 金句
安全评估agent 失控
2:06:53Cognitive Revolution
0814
Lindy 全线跑在 DeepSeek 上,创始人主张封禁中国模型
Flo Crivello 说 Lindy 的 agent 现在整条链路的 driver 就是 DeepSeek,而他同时主张全行业一起被禁——因为竞争对手会用,他就不得不用,宁愿协调解决这个囚徒困境。
12 要点
5 金句
agent 记忆上下文工程