大数跨境

别再让 AI 直接写文献综述了:我把它拆成 8 道工序,最关键的那道不许它写一个字

别再让 AI 直接写文献综述了:我把它拆成 8 道工序,最关键的那道不许它写一个字 AI前沿速递
2026-08-23
4
导读:“证据链比文笔更重要—— AI 辅助文献综述📌 本文看点01证据表先行把文献变成可追溯记录02冲突图抓分歧让

证据链比文笔更重要

—— AI 辅助文献综述

📌 本文看点

01

证据表先行

把文献变成可追溯记录

02

冲突图抓分歧

让综述脱离摘要拼盘

03

审计再交稿

作者保留最终判断权

01

WHY

一、你卡住的不是“写”,是证据还没变成判断

先描一个场景

你下载了几十篇论文,收藏夹塞满了,笔记里写了不少“效果很好”“能解决长距离依赖”“泛化能力较强”。真正开始写 Related Work 那天,你打开 Word,标题写好了,光标在下面闪了四十分钟。

你不是在等一个好句子。你是在等一个决定:这几十篇文献,到底该按什么顺序排出来?

最后你多半会退回到唯一还写得下去的那种写法:

A 研究了什么,B 提出了什么,C 又改进了什么。

三十个作者、三十个年份、三十个引用串起来,段落看着很忙,读者却不知道这些工作在争什么,更不知道你的研究要接在哪个缺口上。这就是导师那句评语的来源:这不是综述,是摘要拼盘。

于是很多人把它交给了聊天框。而 AI 写这种堆砌,写得比你还顺。

这才是真正危险的地方:它不是不会写,是它能把不完整的证据,写成一段非常像论文的确定结论。

它会把某篇论文作者自报的结果,写成领域公认的事实;把不同数据集、不同指标、不同预测窗口下的数字,拼成一个看起来很整齐的排行榜;缺个引用,它顺手补一个格式完美但并不存在的 DOI。

文字变漂亮了,证据链却没有变完整。而综述被审稿人抓,抓的从来是证据链,不是文笔

那为什么聊天框治不好这个病?三个死穴:


综述正文是万字级、跨几十份材料、要做几周的长程任务,聊天框是短程无状态的;


综述的生命线是可回溯(每句话都要能指回原文哪一页),聊天框的产物断了链;


综述是增量做出来的(今天加两篇,下周砍一节),聊天框每次都从零开始。

所以我后来把问题换了个问法:

不要先让 AI 写综述,而是让它先把综述变成一组可以检查的研究判断。


02

CODEX

二、为什么拿 Codex 举例

很多人对 Codex 的印象还停在“OpenAI 的写代码工具”,这个印象在 2026 年已经过时了。它现在是一整条产品线:桌面 App、命令行 CLI、IDE 扩展、云端任务,外加技能系统、分层指令文件(AGENTS.md)、定时自动化、子代理、MCP 外部工具接入。OpenAI 自己也在把它往“不止于软件开发的通用工作代理”上推。

但对写综述的人来说,真正有用的只有三件事,正好一一对上前面三个死穴:

① 它有文件系统 → 上下文不靠“记住”,靠“写下来”。你的综述项目从此不是一串对话,是一个工作区。上下文丢了没关系,文件还在。

② AGENTS.md → 把“项目宪法”一次写死。 Codex 启动时自动读取它作为项目指令,而且分层:全局一份、项目根一份,越靠近工作目录的优先级越高。导师的体例、你的禁令、引用格式、术语表全写进去,每次任务自动继承。

③ 可批处理 + 可 diff(配 Git)→ 增量、可回滚、可审计。你终于能回答“这句话是哪一版加的、依据是哪条来源”。

先说清楚:核心是流程,不是 Codex。Claude Code、Gemini CLI、Cursor 逻辑几乎一样,AGENTS.md / SKILL.md 现在基本已是跨工具通用格式。你换工具,下面 8 道工序一个字都不用改。


03

OVERVIEW

三、八道工序总览

...text

S0 工作区 建目录,写 AGENTS.md

S1 任务契约 把"帮我写综述"翻译成可验收的任务

S2 证据表 文献先进表,不进正文 ★ 防幻觉主闸

S3 主题地图 从"论文顺序"切到"方法族与争论"

S4 冲突图 找出谁和谁在吵,为什么吵 ★★ 拼盘/论述的分水岭

S5 主张台账 把要说的话拆成可审计的 claim

S6 两轮成文 先骨架,后正文(证据封锁)

S7 审计 越界、和稀泥、引用,三类一起查

S8 降 AI 味 只改语言,不动论点

唯一铁律每道工序的产出必须落成文件,不能停留在对话里。

唯一顺序建议:S4 绝对不能跳。跳了它,S5 到 S8 做得再干净,出来的还是拼盘。

工作区长这样

...text

review-project/

├─ AGENTS.md # 工作区规则与证据边界

├─ 00_Inbox/ # 待核对的阅读笔记

├─ 10_Evidence/evidence_table.csv # 证据表:正文唯一的事实入口

├─ 20_Synthesis/

│ ├─ THEME_MAP.md # 主题与方法族

│ ├─ DISAGREEMENT_MAP.md # 冲突图 ★

│ ├─ CLAIM_EVIDENCE_LEDGER.md # 主张—证据台账

│ └─ PARAGRAPH_PLAN.md # 段落骨架

├─ 30_Draft/review_draft.md

└─ 90_System/

├─ AUDIT_REPORT.md

└─ REVIEW_QUEUE.md # 待补证据队列


04

DEEP DIVE

四、逐道拆开

S1|任务契约:把“帮我写综述”翻译成可验收的任务

帮我写一篇文献综述”不是一个完整任务。至少要先说清五件事:

项目
需要明确的内容
综述类型
叙述性、范围、系统,还是方法综述
正文位置
Related Work、理论框架、研究现状,还是讨论
核心问题
解释趋势、比较方法,还是定位缺口
证据边界
只用已核对全文的论文,还是允许摘要级线索
输出契约
主题数、段落数、字数、引用格式、语言

这里有个最常见的错误,值得单独说:很多人把“范围”当成了“问题”。

【替换:某方向】的研究进展”——这不是问题,这是范围。范围只能生出目录,问题才能生出论证。

一份合格的契约长这样

...text

章节:Related Work——长期时间序列预测

核心问题:不同方法族如何处理长预测窗口中的表示、趋势与周期结构?

材料范围:只使用已完成全文核对的论文笔记;摘要级记录只能作为 background。

组织方式:按方法假设分成 3 个主题,不按发表年份逐篇罗列。

输出要求:每个主题 1 段,共 3—4 段;每段包含代表工作、横向比较、共同限制、向本文的过渡。

引用要求:只引用证据表中存在的 cite_key;缺失信息标 [VERIFY],不得补写。

这一步的验收标准拿任意一篇文献来,你都能说出它跟这个核心问题是什么关系。做不到,说明契约还没打磨好,别往下走。

S2|证据表:文献先进表,不进正文 ★

这是全流程的防幻觉主闸

关键在于,让 AI 做的是抽取,不是总结

总结 = 让 AI 决定什么重要 → 你得到一段没有信息密度的话,还没法核验。

抽取 = 你规定字段,AI 只负责填空 → 你得到结构化数据,每格都能查。

每篇论文先变成一行可追溯记录,最少这些字段:

字段
写什么
为什么必须有
source_id
稳定编号,如 SRC-001
文件改名后仍能追溯
cite_key
正式引用键
防止引用对不上文献
research_question
论文试图回答的问题
区分主题相近但问题不同的工作
method_family
方法族或核心假设
后续按争论组织正文
population_dataset
数据、任务、预测窗口或样本
限定结论适用范围
reported_finding 作者明确报告了什么
保留“作者报告”这条边界
limitations
协议缺口、偏差、未验证部分
让缺口能进入综合段落
verification_status fulltext-checked
 / abstract-only / metadata-only
防止把线索当证据
locator
页码、表号、章节
后面审计要靠它回原文

这一步有个概念必须掰清楚,它是整套方法的地基:

作者报告 ≠ 当前材料支持 ≠ 独立复现。

论文里写“我们发现 X”,这只是作者报告。它进你的证据表时必须写成“作者报告 X”,不能写成“X 成立”。而“当前材料支持”是指:你手上这批笔记合起来,能支撑到什么程度。“独立复现”则是另一回事,绝大多数综述里你根本没做过。

这三样在 AI 笔下会自动融成一句“研究表明”。而审稿人最爱抓的就是这一句。

同理,fulltext-checked 只表示“这条记录能回到全文”,不表示你复现过实验。

S3|主题地图:从“论文顺序”切到“方法族与争论”

逐篇介绍论文,必然写成流水账。正文需要的是一个更高层的问题:这些研究在哪个维度上相同,又在哪个维度上分歧?

四种综合动作


收敛多项研究在相近条件下指向同一结论;


分歧结果不同,原因可能来自数据、指标、窗口或设计;


演进早期解决描述问题,后续转向机制解释或外部验证;


缺口一个关键比较、样本、协议或机制长期没被补齐。

以演示主题为例,三篇论文从“谁先发表”改成三条路线:

1

通过 patch 或 token 改变输入表示

2

通过分解或线性映射提供简单控制;

3

通过周期结构或二维重排建模多尺度变化。

换个学科也一样成立教育领域可以是“三种对学习效果的归因路径”,临床可以是“三类对同一终点的测量口径”。变的是内容,不变的是“按争论组织,不按论文组织”。

S4|冲突图:拼盘和论述的分水岭 ★★

整篇文章你只记住这一节也够了。

上一步的收敛/分歧/演进/缺口,很多人当成四选一的标签打完就过。这是最大的浪费。“分歧”不该是主题地图里的一个字段,它值得一道独立工序、一份独立产物、一个独立的人工判断闸门。

因为综述的价值,几乎全部产生在分歧处。

产出 DISAGREEMENT_MAP.md

...text

DIS-01:【某个具体结论】在什么条件下成立

├── 支持方:SRC-003, SRC-017, SRC-022

├── 反对方:SRC-008, SRC-031

├── 分歧归因候选(AI 列全,不要挑):

│ ├── 样本层面? 支持方多为单中心,反对方为多中心

│ ├── 测量层面? 两派用了不同量表/指标实现

│ ├── 情境层面? 一派在 A 场景,一派在 B 场景

│ ├── 时间层面? 早期研究 vs 条件变化后的研究

│ └── 分析层面? 数据划分、预测窗口、统计模型不一致

├── 👤 人工判定主因:__________(这一栏 AI 不许填)

└── 目前无法判定的部分:

为什么“归因”这栏必须留给你?

因为 AI 在这里有一个非常隐蔽、也非常致命的坏习惯:它太会和稀泥。

你让它比较两篇结论相反的文献,它十有八九给你这一句:

两项研究从不同角度提供了互补的视角。

这句话不夸大、不越界、不编造,任何引用审计都查不出问题——但它把综述最值钱的部分整个抹掉了。

注意,这跟“说过头”是两个方向相反的失败说过头是把弱证据写强,和稀泥是把真冲突写没。大部分人只防前者,所以后者一路畅通到终稿。

AI 能帮你把冲突找出来,但只有你能解释冲突。这就是标题里“不许它写一个字”的意思——在这一道,让它列表,别让它写段落。

S5|主张台账:把要说的话拆成可审计的 claim

正文写作前,先把准备说的每句判断,变成一条能被单独审计的记录:

claim_id
paragraph_id
claim
source_ids
locator
scope
evidence_strength
status
CLM-001
P-01
一句可被支持或反驳的话
SRC-001, SRC-003
页码/表号
任务/样本/协议
strong
verified

两组标签,别搞混:

evidence_strength(这条证据对这条主张的支持力度)

标记
使用条件
strong
直接检验了与该主张相同的关系、机制或结果
partial
只支持一部分、较窄样本或相近方法
background
提供背景,不是该主张的主要证据
contradictory
与其他证据冲突,或明确限制该主张

status(这条主张目前的状态)verified表述能回到来源且没超范围)/uncertain(证据不完整)/contested(来源之间有未解决的冲突)。

这里有个坑,我见过不止一版模板踩evidence_strength 是相对于主张的,不是文献本身的属性。同一篇论文,对 CLM-001 可能是 strong,对 CLM-007 就只是 background。所以它属于主张台账,不属于证据表。放错地方,后面所有的强弱判断都会失真。

S6|两轮成文:先骨架,后正文

AI 写得像不像论文,往往不取决于模型多强,而取决于你给它的输入是不是“可写材料”。空白聊天框里只有主题,它只能用常识补缝;工作区里有证据表、冲突图、主张台账,它才能围绕既定判断组织语言。

第一轮只写骨架每段的中心句、证据编号、比较维度、限制、过渡。不写完整 prose,不许润色。

第二轮才写正文,而且要“证据封锁”:只能用本段挂载的 source_id;每个可核查事实后保留 cite_key;不许引入台账之外的任何文献。

写出来应该长这样

现有长期预测研究大致形成三条表示路径。第一类工作把连续序列切分为更适合建模的局部单元,第二类工作用低复杂度映射检验复杂结构是否带来额外收益,第三类工作显式编码多周期变化。三类方法的差异不只在网络组件,而在于它们对“长预测窗口中的有效结构”做出了不同假设。现有证据能够支持方法假设的横向比较,却还不足以在未对齐协议下给出统一排名,这也构成了后续实验需要补齐的比较条件。[SRC-001;SRC-002;SRC-003]

这段的骨架就是五句法

1

先给出主题总判断

2

放入两到四个代表性工作

3

指定一个横向比较维度

4

说清共同限制或分歧来源

5

过渡到你的研究问题

一段只服务一个中心判断。想同时讲历史、性能、机制和未来方向,先拆段。

至于英文论文先用中文确认“要说什么”,再做英文转写。 直接让 AI 生成英文段落,逻辑越界会被漂亮的句式盖住。

S7|审计:三类问题一起查

初稿出来别只问“语言顺不顺”。真正有价值的第二问是:哪些内容超出了来源的支持范围?

审计问题
典型风险
修复方式
来源是否真实存在
cite_key
 没有对应记录
标 [VERIFY CITATION],暂停发布
这条来源是否支持这句话
引用挂段末,只支持半句
拆句,分别绑定证据
结论范围是否被扩大
“一个数据集有效”→“普遍有效”
补上任务、数据、协议边界
不同研究是否可直接比较
指标、样本、窗口不一致
改为条件性比较,列出缺口
是否把冲突写成了互补
“提供了互补的视角”
回 DISAGREEMENT_MAP 取归因,改写成条件性分歧
是否出现 AI 套话
“近年来受到广泛关注”
换成具体机制、数量或限制

倒数第二行是我加的,也是最容易漏的一行。

问题按 P0引用不存在/捏造,立即处理)到 P3(语气套话,最后统一润色)分级,先清 P0、P1 再谈润色。

举个例子,下面这句很像综述,但不够可靠:

这些方法都在多个任务上显著优于传统模型,证明了深度架构的普适优势。

审计后应该更窄:

在各自论文报告的实验协议下,不同方法分别展示了对特定任务或数据集的收益;由于预测窗口、数据划分和指标实现尚未逐项对齐,现有材料不能支持“普适优势”或跨论文统一排名的判断。

后一句不一定更有气势,但它经得起追问。综述的价值不是把所有论文都夸一遍,而是把证据之间的关系说清楚。

然后是这一节最重要的一句:

无论 AI 的审计报告跑得多干净,你必须亲自抽检。

具体做法:从审计判为“无问题”的条目里随机抽 20%(不是挑你有印象的),亲自打开原文,翻到 locator 那一页,自己判断这句话是否真的被支持。如果抽检中出现 1 条以上明确不支持,整轮审计作废,回 S2 检查证据表质量

(20% 和“1 条”是经验值,不是什么标准,你按稿件重要性自己调——毕业论文和课程作业显然不该同一个阈值。)

为什么不能全交给 AI:同一个模型写的稿、同一个模型来审,它对自己那套表述天然更宽容。 这 20% 是整条流水线唯一的外部校准点。

S8|降 AI 味:只改语言,不动论点

最后一道才处理“读起来像不像人写的”。

硬约束:不改变任何研究判断、证据范围、数字、引用和限制;保留所有 cite_keysource_id 和 [VERIFY] 标记;保留条件性措辞(“在该研究协议下”“当前材料支持”)。

顺序不能反。先润色再核验,你会花大量时间打磨一段最终要被砍掉的话。


05

ROLES

五、谁干哪一段

工序
AI 能干的
你必须亲自干的
产出物
S1 任务契约
追问、找缺失项
核心问题的最终判断
契约
S2 证据表
批量抽取填空
抽检 5 条
evidence_table.csv
S3 主题地图
聚类、列比较维度
定维度、砍主题
THEME_MAP.md
S4 冲突图
找出谁和谁打架
★ 解释为什么打架 DISAGREEMENT_MAP.md
S5 主张台账
挂证据、标强度
★ 决定说什么、不说什么 CLAIM_EVIDENCE_LEDGER.md
S6 成文
按封锁条件成稿
读一遍再往下
review_draft.md
S7 审计
跑三类审计
★ 随机抽检 20% AUDIT_REPORT.md
S8 降 AI 味
语言层修订
确认论点没被改动
修订稿

AI 承担的全是执行层,你承担的全是判断层。

这不是因为 AI 不够强,而是因为判断本来就是这篇综述的全部学术价值。如果判断也外包了,那这篇综述本身就没有存在的必要。


06

QUICKSTART

六、一小时跑通第一版

别一上来塞一百篇。先做小闭环:

...text

0—10 分钟 建工作区,写 AGENTS.md,放 5—10 篇最相关的论文笔记

10—25 分钟 跑 S1、S2,得到任务契约与证据表(只读模式,别让它改你的笔记)

25—35 分钟 跑 S3、S4,人工确认 3 个主题和至少 1 个分歧点

35—50 分钟 跑 S5、S6,先骨架、后正文,写 3—4 段

50—60 分钟 跑 S7,清完 P0 和 P1,再进 S8

第一遍大概率超时,这很正常——你在建的是一条以后能重复用的流水线,换主题、换论文、换章节都沿用同一组中间产物。第二次跑,时间会砍掉一半以上。


07

RED LINES

七、四条红线

① 学术诚信与披露。不同期刊、不同学校对 AI 辅助的政策差别很大且更新频繁,投稿前查目标期刊作者须知,毕业论文查你们学校当年规定。有一点是普遍共识:生成式工具不能列为作者,因为它无法对研究内容承担责任。

② 幻觉引文。不核验就投出去,赌的是你自己的学术记录。这类问题一旦被发现,杀伤力远超“写得不好”。

③ 数据安全。未发表数据、涉密材料、受伦理审批限制的原始资料,不要往云端传。要用就用本地模式,并确认沙箱与权限设置。合作项目事先跟合作方讲清楚。

④ 别让它替你读文献。证据表是给你读的加速器,不是替你读的替身。你对一个领域的“手感”——哪个组做事靠谱、哪篇方法有硬伤、哪个结论大家嘴上认心里不认——不在任何一篇 PDF 里。省掉这一步,你能交出一篇合格的综述,但你不会因此成为这个领域的内行。


08

EPILOGUE

结语

这套流程真正改变的,其实不是“写得更快”。

是它把一件模糊的、无限期的、随时可以拖延的事(“我要写文献综述”),变成了八件边界清楚、有验收标准、每件都能在一两小时内做完的事

写不动,往往不是因为难,是因为看不见“做完”长什么样。

顺序其实只有一句话

先收证据,再做综合;先找分歧,再定主张;写完审计,最后由作者定稿。


09

TOOLKIT

配套福利

这篇讲的是为什么,福利包给的是怎么做——全套可直接复制的物料:

《AI 辅助文献综述正文流水线 · 全套工具包 》


✅ 工作区目录结构 + 一键创建脚本(Mac / Windows 双版本)


✅ AGENTS.md 项目宪法模板含证据边界与禁令清单


✅ 八道工序完整提示词 S1–S8每条含目标、输入、输出、验收标准)


✅ 证据表模板 + 字段字典 + 三级核对状态说明


✅ 冲突图模板含人工判定栏


✅ 主张—证据台账模板 + 两组标签的判据


✅ 段落五句法检查卡 + 可替换骨架


✅ 审计提示词(含反“和稀泥”检查项)+ P0–P3 分级 + 20% 抽检规程


✅ 降 AI 味提示词(只改语言不改论点)


✅ 发布前最终清单 + 常见 9 个坑


✅ 学术诚信声明模板(中英双语)


✅ 一页速查表

如果你也想把"读过很多论文"变成"写得出有证据的综述",后台回复关键词「B791」,添加小助理领取这套工具包:8 组可复制提示词、证据表、冲突图、主张台账、段落五句法和发布前审计清单。




END

想要更多AI使用技巧?回复关键词

B655:nature-skill功能测试

B675:Codex 使用前必做的几个设置:配置、权限和 Skill 一次讲清楚

F424:科研写作与绘图 Skills 汇总推荐

            科研小白需安装的 11 个 SKills 

B678:文献下载管理与综述Skill安装包:literature-review-workflow

B685:创新点设计与可证伪性检验Skill安装包:paper-novelty-design

B716:Zotero + Obsidian + Codex 联动教程

B719:GPT-5.6-Sol-实战指南

B721GPT5.6 安装指南和必装skill

B740GPT做PPT-全流程提示词模板(异常好用)

B754drawio绘图软件、skill和插件安装包

           ChatGPT 5.6 + draw.io 绘图安装、配置和使用
B7572026 年时间序列 × Mamba 顶会论文合集

往期推荐:
15 天,两家把"最强模型"重新定义了一遍:Claude Opus 5 对上 GPT-5.6
一个开源 AI Agent Skill:让论文英文润色贴合原意,并检查结论是否越界
30分钟用 ChatGPT + draw.io 搞定可编辑的论文插图
微软开源 AI 科研神器:ResearchStudio-Idea 筛选可靠创新点,配合 GPT 5.6 太强了!
手把手教学:用GPT+Image2做出能直接上台汇报的专业可编辑PPT,全篇干货

【声明】内容源于网络
0
0
AI前沿速递
AI前沿速递 聚焦人工智能最新科研成果与技术动态,专注前沿论文解读、行业资讯分享与高校招生信息推送,助力AI爱好者和从业者把握学界风向标。每日更新技术干货与深度内容,让全球优秀研究被更多人看见。关注我们,探索AI无限可能!
内容 1994
粉丝 0
AI前沿速递 AI前沿速递 聚焦人工智能最新科研成果与技术动态,专注前沿论文解读、行业资讯分享与高校招生信息推送,助力AI爱好者和从业者把握学界风向标。每日更新技术干货与深度内容,让全球优秀研究被更多人看见。关注我们,探索AI无限可能!
总阅读21.1k
粉丝0
内容2.0k