AI寫作停滯:長文非虛構是模型能力的試金石
模型在長文非虛構寫作上進步緩慢,暴露了其組織知識能力的缺陷,這比代碼和數學的進步更值得警惕,因為它關乎AI能否解決開放科學問題。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 時間戳為按文稿位置估算
講不清成熟科學,就解決不了開放問題
對AI寫作的批評多集中在創意寫作,認為好寫作需要高辨識度、觀點和人類深度表達。但非虛構寫作,如填充文本,曾是LLM真正有用的能力之一。作者指出,模型在長文非虛構寫作上的停滯,對依賴AI自主解決開放科學問題的人而言,是令人警惕的信號。模型難以組織和呈現其領域內最成熟科學,這應是解決開放問題的前提。
— Nathaniel洞察來自壓縮,而模型在給知識加熵
作者認為,當前AI模型在科學上的進步更像摘取低垂果實和跨領域連接,而非革命性洞察。組織知識是一種壓縮,是產生洞察的必要條件。而LLM在長文非虛構寫作中增加了熵,這無法無限疊加。模型將依賴人類作為引導。儘管如此,作者仍對數學等窄領域科學進步向更廣泛領域的轉化持樂觀態度。
— Nathaniel編碼從平庸到超人,寫作卻原地不動
作者剛完成一本關於RLHF的教科書,期間大量使用LLM輔助排版、校對和繪圖。他原本預期2026年出版非虛構書會顯得過時,但現實是模型在寫作上的進步遠低於預期。一些以寫作能力著稱的模型,如GPT-4.5和Kimi K2,已經算舊了。模型在編碼和數學上已從平庸到超人,但寫作能力卻停滯不前,這感覺與其他技能正交。
— Nathaniel寫作不是被忽視,是推理時擴展還沒解鎖
作者認為寫作並非被忽視,而是挑戰大且缺乏針對性訓練數據。雖然存在一些低垂果實,如專門的工具鏈和提示,但不太可能帶來能力的倍增。寫作是一項非常困難的任務,遺憾的是我們尚未解鎖推理時擴展在寫作上的應用。當前模型在長文技術寫作上表現糟糕,句子尚可,但整章則組織混亂、措辭含糊,還常犯概念錯誤。
— Nathaniel模型能查每一句,串不起整一章
作者觀察到GPT模型在找錯別字和細節問題上表現出色,而Claude模型作為編輯更有品味,更能理解任務的思維模型,提供有趣建議。這些例子表明,模型擅長檢查每個單元的內容,但不擅長將組件串聯起來,導致複合錯誤。在數學和代碼中,RLVR(基於規則的驗證強化學習)神奇地減少了這類錯誤,但寫作中尚無對應方案。
— Nathaniel有專家把關就不算作弊,但這是個滑坡
作者分享在寫書過程中,AI模型貢獻了不到1%的技術解釋句子,因為作者作為專家認可這些句子。在編輯過程中,他使用Claude Code導航編輯評論,區分簡單錯別字和複雜問題,並請求建議。作者認為,如果專家能嚴格把關,使用AI輸出並非作弊,但這是一個滑坡,他最終在第二稿全面審閱時接受了一些AI建議。
— Nathaniel寫作省下的力氣,換掉的是未來的直覺
作者強調,使用AI進行非虛構寫作會削弱理解力的提升,而這種理解力(直覺、品味、本能)在未來更有價值。如果不是專家,就無法發現AI的缺陷。作者寫書是為了回饋社區,因此即使使用AI,只要能完成就是勝利。他承認,如果投入更多人力,學習會更多,產品也會更好,但決定因素是擔心書出版時已過時。
— Nathaniel早期組織階段需要洞察,AI 差得遠
作者認為,AI模型是很好的工具,能將知識轉化為不同形式,適合創作填充材料或背景內容。但在非虛構寫作的早期組織階段,需要洞察力,這是LLM遠遠無法替代的。作者希望更多專家使用AI寫書,以分享更多知識,但目前AI只能節省10-20%的努力,且短期內不會成為多數。社會壓力讓一些人認為寫書無意義,但高質量教育內容始終匱乏。
— Nathaniel散文寫不好,說明數據中心天才還不成立
作者總結,模型在兩種情況下表現出色:一是可驗證的領域,二是有大量上下文的小編輯,如找bug或解決特定數學問題。但在開放式生成散文方面表現不佳。長文寫作將先於創意寫作被攻克,但這是模型無法在欠規範問題中表達全部知識的強烈信號。這限制了模型成為“數據中心天才”解決重大科學問題的能力。
— Nathaniel原話 · 已逐字校驗
Models being stagnant in long-form, non-fiction writing should be alarming to those reliant on models autonomously solving grand, open science problems in the near future.
模型在長文非虛構寫作上的停滯,對於那些依賴模型在不久的將來自主解決重大開放科學問題的人來說,應該敲響警鐘。
Nathaniel0:00
Today’s LLMs increase entropy in long-form non-fiction writing, and I don’t see how that can be stacked on top of itself endlessly.
今天的LLM在長文非虛構寫作中增加了熵,我看不出這如何能無限疊加。
Nathaniel1:30
Writing well is a very hard task! It’s a shame that we haven’t unlocked inference-time scaling for one of the great intellectual pursuits.
寫得好是一項非常困難的任務!遺憾的是,我們尚未解鎖推理時擴展在偉大智力追求上的應用。
Nathaniel3:30
The models know how to check every unit of content, in this case usually a sentence or equation or figure, or make one, specific section where you are caught.
模型知道如何檢查每個內容單元,通常是一個句子、等式或圖表,或者製作一個你卡住的特定部分。
Nathaniel4:30
Using AI for non-fiction writing takes away from that progression. Doubly, if you weren’t already an expert you won’t be able to catch its flaws.
使用AI進行非虛構寫作會削弱這種進步。再者,如果你還不是專家,你將無法發現它的缺陷。
Nathaniel7:30
The problem is that you can only use AI models to save 10-20% of the effort today, and I don’t see that percentage becoming the majority anytime soon.
問題是,如今你只能使用AI模型節省10-20%的努力,而我看不到這個比例在短期內成為多數。
Nathaniel9:00
Long-form writing will definitely fall before creative writing, but it’s a strong tell that the models are not able to express the full extent of their knowledge in underspecified problems.
長文寫作肯定會在創意寫作之前被攻克,但這是一個強烈的信號,表明模型無法在欠規範問題中表達其全部知識。
Nathaniel10:30
數字與實體
| AI模型在書中貢獻的句子比例 | 不到1% | 5:42 |
| AI模型節省寫作努力的比例 | 10-20% | 9:00 |
| 書籍頁數 | 200-300頁 | 4:30 |
| 同步Markdown和LaTeX版本所需時間 | 數十小時,使用AI代理後節省五倍時間 | 7:00 |
術語
- RLVR基於規則的驗證強化學習
- 一種強化學習方法,通過規則驗證獎勵模型,減少複合錯誤。
- RLHF基於人類反饋的強化學習
- 一種訓練方法,利用人類反饋優化模型行為。
- inference-time scaling推理時擴展
- 在推理階段增加計算量以提升模型性能的技術。
收聽指南
關注AI能力邊界的研究者、技術寫作者、以及依賴AI進行知識工作的創業者。
開頭對AI寫作批評的概述可略讀,重點在中後段對模型能力的分析。