AI AI工具情报站
AI资讯tip

AI 还要多久才能写得更好?

Nathan Lambert:Interconnects(RSS)2026-08-12T13:01:16.000Z

核心亮点

在完成一本关于 RLHF(基于人类反馈的强化学习)的教科书之后,作者 Nathan Lambert 反思了一个尴尬的现实:模型在长篇非虚构写作上的进展已经明显停滞,而它们在编程、数学等任务上却已逼近甚至超过人类水平。写作上的停滞与技术上的飞跃之间的落差,正是他提出的核心难题,对曾希望语言模型很快能独立写严肃书籍的人有重要含义。

具体能力或事件经过

作者观察到,像 GPT 4.5、Kimi K2 这类一度以写作出众的模型,如今在长篇内容创作上已经显得过时。模型确实能帮忙改错别字、做局部编辑,但一旦要求它组织一整章的逻辑结构,表现就会变得混乱且容易出错。这种能力与编码、数学上的飞速进步形成了鲜明反差,也让作者担心模型难以自主推进开放性的科学问题,因为这类问题需要在许多页之间保持连贯而有说服力的论证。

技术细节

RLHF 通过人类反馈来对齐模型输出,它在短文本和可控任务上效果显著,却难以覆盖长篇写作所需的全局一致性。长文本要求在数十页范围内保持论点、术语与风格的统一,而当前模型的上下文管理与规划能力仍然薄弱,导致章节级别的生成质量不稳定。让一段文字听起来礼貌的训练信号,并不会自动产生一本从头到尾浑然一体的书。

与竞品对比

在写作这一维度上,各家旗舰模型并没有拉开明显差距,反而都在同一道瓶颈前停滞。相比之下,编码与数学因为评测清晰、反馈明确,进步速度远快于写作,这种不均衡值得社区警惕,而不只是当作趣闻。写作仍是那种基准分数无法捕捉真实难度的硬骨头。

行业影响或适用场景

对于依赖 AI 辅助科研与写作的用户,结论并不乐观:至少在可见的未来,模型更适合做校对与片段润色,而非独立撰写完整论著。简单来说,把整本书交给模型写,现在还远不到时候,人类作者在组织结构、判断力和那种经年训练才有的连贯性上仍然不可或缺。