1

现在,利用AI Agent写论文已经不再是一件困难的事。

一个配置完善的Agent可以读取整个LaTeX仓库,浏览Methods和Results,查看图注,检索相关文献,生成BibTeX,修改正文,运行编译,甚至调用另一个Agent对稿件进行审核。

从工程角度看,论文写作似乎已经变成了一条可以自动运行的流水线。

但很多真正使用过这套流程的人,都会遇到一个奇怪的问题:

AI写出的每一句话都像论文,整篇文章却不像一位成熟科学家写的论文。

它可能语法正确、结构完整、术语丰富,甚至充满“high-impact journal”的表达。然而,读完以后,你仍然不知道这项研究究竟解决了什么问题,也记不住它最重要的贡献。

问题出在哪里?

答案可能不是模型不够强,也不是提示词不够长,而是我们误解了科学写作究竟是什么。


科学写作并不是把已经完成的研究“翻译成英文”

2025年,Nature Reviews Bioengineering发表了一篇题为《Writing is thinking》的社论。文章提出,写作不仅是报告研究结果,也是研究者整理多年数据、发现核心信息、理解工作意义的过程。把整篇论文外包给大语言模型,可能同时放弃了这部分认知工作。

这句话解释了为什么AI常常能完成“文字工作”,却不能自动完成“论文工作”。

一篇论文至少包含四种不同任务:

  • 事实提取:做了哪些实验,得到了哪些结果;
  • 科学判断:哪些结果最重要,证据支持到什么程度;
  • 叙事设计:读者应该按照什么顺序理解这项工作;
  • 语言表达:如何用准确、清楚的文字呈现论证。

AI最擅长第四项,也越来越擅长第一项。

真正困难的是中间两项。

而当我们对Agent说“阅读整个仓库,帮我写Introduction”时,实际上是要求它在一次任务中完成全部四项工作。

模型往往会选择最容易的路径:提取仓库中出现频率最高、描述最详细的技术信息,再把它们重新排列成一段流畅的英文。

结果不是科学叙事,而是Methods的压缩版。


陷阱一:长上下文不等于真正理解整个仓库

很多人认为,只要模型支持几十万甚至上百万token,就可以把整个论文仓库一次性交给它。

但“能够放进上下文”不等于“能够同等有效地使用所有上下文”。

发表于Transactions of the Association for Computational Linguistics的“Lost in the Middle”研究发现,即使是支持长上下文的模型,对信息的使用也受到位置影响:相关信息位于上下文开头或末尾时表现较好,位于中间时性能可能明显下降。

在论文仓库中,这会产生几个问题:

  • 写得最长的模块被误认为最重要的贡献;
  • Methods中的具体术语压过了散落在讨论和图注中的核心思想;
  • 旧稿、TODO、注释和废弃表述混入当前叙事;
  • 高频出现的工程实现成为文章主线;
  • 真正重要但只出现过一两次的科学判断被忽略。

因此,把整个仓库交给Agent,不一定会让它形成更完整的理解,反而可能造成更强的细节锚定

怎么解决?

不要让写作Agent直接面对完整仓库。

先由一个“事实提取Agent”读取Methods、Results和图注,生成结构化中间文件:

  • 研究目标;
  • 已实现能力;
  • 每项能力对应的证据;
  • 尚未证明的能力;
  • 必须保留的适用边界。

之后,负责叙事设计的Agent只读取这些经过压缩的中间表示,而不是重新扫描全部Methods。


陷阱二:AI擅长总结,却不一定擅长抽象

总结和抽象并不是同一件事。

假设一个系统包含十个模块。

总结是把十个模块分别缩短介绍一遍。

抽象则是发现,这十个模块实际上属于三个更高层的科学概念,并判断读者只需要先记住这三个概念。

AI很容易输出:

系统包含A、B、C、D和E模块,并支持X、Y、Z数据类型。

这类句子通常没有事实错误,但读者得到的只是一份功能清单。

成熟的论文作者会继续追问:

  • 这些模块为什么需要共同存在?
  • 它们是否对应不同层次的科学问题?
  • 如果删除全部实现名称,还剩下什么核心贡献?
  • 读者一年以后应该记住这篇论文的哪一句话?

在一项比较真实摘要与ChatGPT生成摘要的研究中,人类评审虽然发现AI文本具有较高的迷惑性,但也认为被怀疑为AI生成的文本往往更加模糊和公式化。

这种“模糊但像论文”的感觉,正是抽象失败的典型表现。

它不是没有概括,而是使用了宏观词汇,却没有建立真正的概念结构。

怎么解决?

在写正文以前,强制Agent把每项贡献写成三个层级:

  1. 实现层:具体做了什么;
  2. 架构层:这些操作在整篇文章中承担什么功能;
  3. 科学意义层:这些功能怎样改变了现有的研究方式。

如果Agent不能在不使用专有名词的情况下说明论文贡献,说明它还没有完成真正的抽象。


陷阱三:文字很完整,论证却很浅

AI写作最容易制造的一种错觉是:

只要句子足够完整,逻辑连接词足够多,论证就已经成立。

模型会自然加入:

  • however;
  • therefore;
  • collectively;
  • by contrast;
  • taken together;
  • these findings suggest。

这些词能够让段落看起来严密,但连接词不能替代科学关系。

npj Artificial Intelligence的一项研究将这一现象称为“shallow reasoning”:LLM生成的审稿回复可能在结构和语言上十分完整,却没有真正回应审稿意见的核心。

同样的问题也会出现在论文正文中:

  • 两个并列模块被写成因果关系;
  • 一个技术限制被上升为整个领域的根本瓶颈;
  • 实现了某个功能被写成验证了该功能的科学价值;
  • 若干示例被概括为普遍适用;
  • 参数扫描被表述为自主科学发现。

语言可以掩盖论证缺口,却不能填补论证缺口。

怎么解决?

为每个关键句建立“主张—证据映射”:

  • 这句话包含几个可验证主张?
  • 每个主张由哪个结果支持?
  • 证据是实现、展示、评估还是验证?
  • 句子的动词是否超过了证据强度?

陷阱四:相关工作变成论文名称的连续罗列

AI在写作时,,通常会搜索大量相关论文。

问题是,它很容易按照检索结果的顺序写作:

方法A完成了什么,方法B完成了什么,方法C又完成了什么。

这看起来文献充分,实际上没有形成领域认识。

相关工作的作用不是证明作者读过很多论文,而是帮助读者建立分类:

  • 现有方法解决了哪几类问题;
  • 每一类方法的共同假设是什么;
  • 不同类别之间有什么差异;
  • 它们共同遗漏了什么问题。

怎么解决?

采用“类别先于例子”的原则:

  1. 先用两到四个上位概念组织领域;
  2. 说明每一类方法提供了什么能力;
  3. 每类只选择一到两个代表性例子;
  4. 最后指出各类别共同未解决的问题。

文献是论证的证据,不应成为段落的骨架。

Agent检索论文时,也不应该只保存完整句子,而应提取:

  • 标准术语;
  • 常见学术搭配;
  • 方法分类;
  • 修辞功能;
  • 概念的适用边界。

查论文是为了学习这个领域如何准确表达问题,而不是寻找可以直接贴入Introduction的句子。


陷阱五:引用看起来真实,不代表引用真的支持句子

文献引用是AI科学写作中风险最高的部分之一。

Scientific Reports曾系统评估ChatGPT生成的参考文献,发现其中存在虚构论文以及真实论文书目信息错误的问题。

即使新模型减少了完全虚构的引用,问题也没有消失。2026年一项针对GPT-5生成医学综述的研究发现,文章整体结构和事实准确性可以较好,但完全准确的参考文献仍只占约三分之一,暴露出证据综合和引用可靠性的明显弱点。

更隐蔽的问题不是“论文不存在”,而是:

论文存在,但不支持当前句子的完整主张。

例如一句话同时声称某方法能够做到1,2,3 三件事,但引用的论文可能只证明了其中一项。

怎么解决?

不要让AI直接“为段落补引用”。

应建立citation ledger:

  • 当前主张;
  • 对应文献;
  • 文献中的支持内容;
  • 支持强度;
  • 是否为原始研究;
  • 是否需要增加限定。

引用审核必须回到论文原文,而不能只看标题、摘要或搜索结果。


陷阱六:让同一个Agent写作和审核

很多Agent工作流采用:

生成初稿 → 自我反思 → 修改初稿。

这看起来合理,却有一个根本问题:模型容易沿用自己第一次生成时建立的假设。

ICLR 2024的一项研究发现,在缺少外部反馈和正确标签时,LLM的“内在自我纠正”并不稳定,有时修改后的推理甚至比初稿更差。

在论文写作中,同一个Agent既当作者又当审稿人,往往会出现:

  • 不愿推翻自己刚刚建立的段落结构;
  • 把措辞修改误认为论证修改;
  • 对自己发明的上位概念更加宽容;
  • 认为自己刚写的版本已经“清晰、严谨且有影响力”。

怎么解决?

至少分开三个角色:

Writer

只负责根据叙事蓝图生成文字。

Scientific auditor

只检查事实、证据、限制和引用,不评价文风。

Editorial critic

只检查段落功能、信息层级、概念压缩和读者体验。

审核Agent不应看到Writer的解释和自我评价,只获得稿件、事实清单和评分标准。


陷阱七:AI让单篇文章变好,却让所有文章越来越像

AI生成的文字通常具有稳定的偏好:

  • 喜欢完整的三分结构;
  • 喜欢平衡、对称的句式;
  • 喜欢宏观而安全的开头;
  • 喜欢使用相似的转折和总结表达;
  • 倾向于消除不规则、犹豫和个人语言特征。

Science Advances的一项实验发现,获得生成式AI帮助的参与者能够写出平均评价更高的故事,但这些故事彼此之间也更加相似。

这一结论虽然来自创意写作实验,却对科学写作同样具有警示意义:

AI可能提高单篇文字的局部质量,同时压缩整个学术共同体的表达多样性。

Nature上的一篇来信进一步担忧,AI写作工具可能让部分研究者逐渐用中心化的语言模式替换自己的表达方式,从而削弱不同学术文化和研究传统的声音。

怎么解决?

不要让AI负责你的第一版科学判断。

在调用AI以前,作者至少应自己写出:

  • 本段唯一任务;
  • 希望读者记住的一句话;
  • 采用的概念分类;
  • 明确不写入本段的细节;
  • 不能突破的科学边界。

AI可以给出替代表达,但不能首先决定文章的认知结构。


陷阱八:Agent提高了效率,也扩大了保密和责任风险

当Agent能够读取整个代码和论文仓库时,它接触的不只是文字,还可能包括:

  • 未发表结果;
  • 合作者信息;
  • 内部评审意见;
  • 数据路径;
  • 尚未申请专利的方法;
  • 旧版稿件和隐含身份信息。

Nature Methods在2026年的社论中强调,研究者不能把AI生成的内容直接视为可靠文本,必须进行事实检查和人工编辑;其政策也明确禁止审稿人把未发表稿件上传到生成式AI工具,因为这可能破坏同行评审的保密性。

Nature和Science也都强调,AI不能成为论文作者,因为它不能对研究内容承担责任;使用AI辅助写作时,责任最终仍属于人类作者。

怎么解决?

建立清晰的数据边界:

  • 未发表稿件只进入经过批准的环境;
  • 不把完整仓库上传到公开或不明数据策略的服务;
  • 对示例、日志和Skill语料进行脱敏;
  • 保存使用的工具、版本和关键操作记录;
  • 根据目标期刊要求披露AI使用情况;
  • 所有最终主张、数据和引用由作者确认。

Agent可以执行任务,但不能继承作者责任。


不要让Agent替你绕过写作中最困难的部分

围绕AI科学写作,也存在另一种值得重视的观点。

2026年,Nature Reviews Bioengineering刊登评论《Thinking is not only writing》,指出不能简单地把AI辅助起草等同于放弃思考。 真正重要的,是作者是否进行了充分、创造性和负责任的智力参与。 该文作者也说明,他们对AI起草内容进行了多轮逐句修改,最终文本几乎不再保留原始AI表述。

因此,我认为问题不在于是否使用AI,而在于人类把什么交给了AI。

如果研究者已经确定了论文的核心问题、贡献层级、证据边界和叙事方向,AI可以成为非常强大的写作基础设施。但如果研究者把这些判断也一并外包,Agent生成的往往只是:

一篇语法正确、结构完整、引用丰富,却没有真正作者的论文。

科学写作中最令人痛苦的部分,删除正确但不重要的细节、承认证据尚不充分、在多个故事中选择一个故事、用一句话定义工作的意义,恰恰也是最有价值的部分。

因此,AI Agent写作真正应该自动化的,不是科学家的判断,而是围绕判断发生的大量机械性、重复性工作。 文章初稿决定论文能够说什么,文献决定这个领域通常怎样说,Agent帮助整理和检查,而研究者必须决定什么值得说。 这或许才是AI时代更可靠的科学写作方式。


参考阅读

  1. Writing is thinking, Nature Reviews Bioengineering, 2025.
  2. Thinking is not only writing, Nature Reviews Bioengineering, 2026.
  3. Tools such as ChatGPT threaten transparent science; here are our ground rules for their use, Nature, 2023。
  4. Using AI responsibly in scientific publishing, Nature Methods, 2026.
  5. Quantifying large language model usage in scientific papers, Nature Human Behaviour, 2025. 该研究分析了超过112万篇论文和预印本,显示LLM辅助修改已经广泛进入科学写作。
  6. Generative artificial intelligence enhances creativity but reduces the diversity of novel content, Science Advances, 2024.
  7. Lost in the Middle: How Language Models Use Long Contexts, Transactions of the Association for Computational Linguistics, 2024.
  8. Fabrication and errors in the bibliographic citations generated by ChatGPT, Scientific Reports, 2023.
Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐