AI写作停滞:长文非虚构是模型能力的试金石
模型在长文非虚构写作上进步缓慢,暴露了其组织知识能力的缺陷,这比代码和数学的进步更值得警惕,因为它关乎AI能否解决开放科学问题。
核心论点 · 时间戳为按文稿位置估算
AI写作批评的盲区
对AI写作的批评多集中在创意写作,认为好写作需要高辨识度、观点和人类深度表达。但非虚构写作,如填充文本,曾是LLM真正有用的能力之一。作者指出,模型在长文非虚构写作上的停滞,对依赖AI自主解决开放科学问题的人而言,是令人警惕的信号。模型难以组织和呈现其领域内最成熟科学,这应是解决开放问题的前提。
— Nathaniel科学进步的局限
作者认为,当前AI模型在科学上的进步更像摘取低垂果实和跨领域连接,而非革命性洞察。组织知识是一种压缩,是产生洞察的必要条件。而LLM在长文非虚构写作中增加了熵,这无法无限叠加。模型将依赖人类作为引导。尽管如此,作者仍对数学等窄领域科学进步向更广泛领域的转化持乐观态度。
— Nathaniel写作停滞的观察
作者刚完成一本关于RLHF的教科书,期间大量使用LLM辅助排版、校对和绘图。他原本预期2026年出版非虚构书会显得过时,但现实是模型在写作上的进步远低于预期。一些以写作能力著称的模型,如GPT-4.5和Kimi K2,已经算旧了。模型在编码和数学上已从平庸到超人,但写作能力却停滞不前,这感觉与其他技能正交。
— Nathaniel写作为何难提升
作者认为写作并非被忽视,而是挑战大且缺乏针对性训练数据。虽然存在一些低垂果实,如专门的工具链和提示,但不太可能带来能力的倍增。写作是一项非常困难的任务,遗憾的是我们尚未解锁推理时扩展在写作上的应用。当前模型在长文技术写作上表现糟糕,句子尚可,但整章则组织混乱、措辞含糊,还常犯概念错误。
— Nathaniel模型的编辑能力
作者观察到GPT模型在找错别字和细节问题上表现出色,而Claude模型作为编辑更有品味,更能理解任务的思维模型,提供有趣建议。这些例子表明,模型擅长检查每个单元的内容,但不擅长将组件串联起来,导致复合错误。在数学和代码中,RLVR(基于规则的验证强化学习)神奇地减少了这类错误,但写作中尚无对应方案。
— NathanielAI辅助写作的实践
作者分享在写书过程中,AI模型贡献了不到1%的技术解释句子,因为作者作为专家认可这些句子。在编辑过程中,他使用Claude Code导航编辑评论,区分简单错别字和复杂问题,并请求建议。作者认为,如果专家能严格把关,使用AI输出并非作弊,但这是一个滑坡,他最终在第二稿全面审阅时接受了一些AI建议。
— NathanielAI写作的平衡
作者强调,使用AI进行非虚构写作会削弱理解力的提升,而这种理解力(直觉、品味、本能)在未来更有价值。如果不是专家,就无法发现AI的缺陷。作者写书是为了回馈社区,因此即使使用AI,只要能完成就是胜利。他承认,如果投入更多人力,学习会更多,产品也会更好,但决定因素是担心书出版时已过时。
— Nathaniel技术写作的未来
作者认为,AI模型是很好的工具,能将知识转化为不同形式,适合创作填充材料或背景内容。但在非虚构写作的早期组织阶段,需要洞察力,这是LLM远远无法替代的。作者希望更多专家使用AI写书,以分享更多知识,但目前AI只能节省10-20%的努力,且短期内不会成为多数。社会压力让一些人认为写书无意义,但高质量教育内容始终匮乏。
— Nathaniel模型的适用场景
作者总结,模型在两种情况下表现出色:一是可验证的领域,二是有大量上下文的小编辑,如找bug或解决特定数学问题。但在开放式生成散文方面表现不佳。长文写作将先于创意写作被攻克,但这是模型无法在欠规范问题中表达全部知识的强烈信号。这限制了模型成为“数据中心天才”解决重大科学问题的能力。
— Nathaniel原话 · 已逐字校验
Models being stagnant in long-form, non-fiction writing should be alarming to those reliant on models autonomously solving grand, open science problems in the near future.
模型在长文非虚构写作上的停滞,对于那些依赖模型在不久的将来自主解决重大开放科学问题的人来说,应该敲响警钟。
Nathaniel0:00
Today’s LLMs increase entropy in long-form non-fiction writing, and I don’t see how that can be stacked on top of itself endlessly.
今天的LLM在长文非虚构写作中增加了熵,我看不出这如何能无限叠加。
Nathaniel1:30
Writing well is a very hard task! It’s a shame that we haven’t unlocked inference-time scaling for one of the great intellectual pursuits.
写得好是一项非常困难的任务!遗憾的是,我们尚未解锁推理时扩展在伟大智力追求上的应用。
Nathaniel3:30
The models know how to check every unit of content, in this case usually a sentence or equation or figure, or make one, specific section where you are caught.
模型知道如何检查每个内容单元,通常是一个句子、等式或图表,或者制作一个你卡住的特定部分。
Nathaniel4:30
Using AI for non-fiction writing takes away from that progression. Doubly, if you weren’t already an expert you won’t be able to catch its flaws.
使用AI进行非虚构写作会削弱这种进步。再者,如果你还不是专家,你将无法发现它的缺陷。
Nathaniel7:30
The problem is that you can only use AI models to save 10-20% of the effort today, and I don’t see that percentage becoming the majority anytime soon.
问题是,如今你只能使用AI模型节省10-20%的努力,而我看不到这个比例在短期内成为多数。
Nathaniel9:00
Long-form writing will definitely fall before creative writing, but it’s a strong tell that the models are not able to express the full extent of their knowledge in underspecified problems.
长文写作肯定会在创意写作之前被攻克,但这是一个强烈的信号,表明模型无法在欠规范问题中表达其全部知识。
Nathaniel10:30
数字与实体
| AI模型在书中贡献的句子比例 | 不到1% | 5:42 |
| AI模型节省写作努力的比例 | 10-20% | 9:00 |
| 书籍页数 | 200-300页 | 4:30 |
| 同步Markdown和LaTeX版本所需时间 | 数十小时,使用AI代理后节省五倍时间 | 7:00 |
术语
- RLVR基于规则的验证强化学习
- 一种强化学习方法,通过规则验证奖励模型,减少复合错误。
- RLHF基于人类反馈的强化学习
- 一种训练方法,利用人类反馈优化模型行为。
- inference-time scaling推理时扩展
- 在推理阶段增加计算量以提升模型性能的技术。
收听指南
关注AI能力边界的研究者、技术写作者、以及依赖AI进行知识工作的创业者。
开头对AI写作批评的概述可略读,重点在中后段对模型能力的分析。