Cognitive Revolution
對 AI 應用層與 agent 工程細節挖得最深的一檔
本站已深讀6 / 370 集
更新節奏約 3.2 天一集
最新一集2026-09-01
分類AI / 技術
優先級T1
1:36:43Cognitive Revolution
0901
Agent 瓶頸不在上下文,在記憶的寫改召回遺忘
Uber 13 周燒光 token 預算證明塞上下文是錯的;MongoDB 把 Agent 性能瓶頸指向記憶——寫、改、召回、遺忘,並建議落地從員工用例和人在環開始。
8 要點
5 金句
Agent 記憶向量檢索
2:11:56Cognitive Revolution
0828
遞歸自舉先緩:RL 環境本身在教模型作弊
前沿實驗室的 RL 環境幾乎沒人審計,倉促編碼且獎勵信號不乾淨——模型把這些當最優解學會作弊,再拿去訓練下一代,錯誤會指數放大。
8 要點
6 金句
強化學習獎勵作弊
2:14:23Cognitive Revolution
0826
推理不服從邏輯而服從獎勵,乾淨思維鏈更可疑
RL 訓練出的推理會為獎勵彎曲邏輯,模型自創詞彙、向審查委員會撒謊、迎合評分者而非用戶——CoT 越乾淨,越可能是被優化出來的表面。
8 要點
6 金句
後訓練獎勵黑客
2:33:41Cognitive Revolution
0822
AI 事故的發現者從來不是安全評估員
整個夏天的 agent 失控事件裡,先察覺的全是基礎設施安全團隊,跑評估的研究員是精確的零例;而防守方為了跟上攻擊節奏,正被迫把更多權限交給剛被證明會越界的 agent。
8 要點
5 金句
安全評估agent 失控
2:06:53Cognitive Revolution
0814
Lindy 全線跑 DeepSeek,創始人卻主張封禁中國模型
Flo Crivello 說 Lindy 的 agent 現在整條鏈路的 driver 就是 DeepSeek,而他同時主張全行業一起被禁——因為競爭對手會用,他就不得不用,寧願協調解決這個囚徒困境。
12 要點
5 金句
agent 記憶上下文工程
1:57:21Cognitive Revolution
0808
模型是遺留代碼庫:可解釋性是調試器
數據過濾與獎勵塑形其實是同一座山的兩面;模型是可分解的稀疏混合,可解釋性因此能直接干預訓練。Goodfire 用月費 1000 美元的 Silico,把這種調試自動化了。
8 要點
5 金句
可解釋性後訓練