“
证据链比文笔更重要
—— AI 辅助文献综述
📌 本文看点
01
证据表先行
把文献变成可追溯记录
02
冲突图抓分歧
让综述脱离摘要拼盘
03
审计再交稿
作者保留最终判断权
WHY
一、你卡住的不是“写”,是证据还没变成判断
先描一个场景。
你下载了几十篇论文,收藏夹塞满了,笔记里写了不少“效果很好”“能解决长距离依赖”“泛化能力较强”。真正开始写 Related Work 那天,你打开 Word,标题写好了,光标在下面闪了四十分钟。
你不是在等一个好句子。你是在等一个决定:这几十篇文献,到底该按什么顺序排出来?
最后你多半会退回到唯一还写得下去的那种写法:
A 研究了什么,B 提出了什么,C 又改进了什么。
三十个作者、三十个年份、三十个引用串起来,段落看着很忙,读者却不知道这些工作在争什么,更不知道你的研究要接在哪个缺口上。这就是导师那句评语的来源:这不是综述,是摘要拼盘。
于是很多人把它交给了聊天框。而 AI 写这种堆砌,写得比你还顺。
这才是真正危险的地方:它不是不会写,是它能把不完整的证据,写成一段非常像论文的确定结论。
它会把某篇论文作者自报的结果,写成领域公认的事实;把不同数据集、不同指标、不同预测窗口下的数字,拼成一个看起来很整齐的排行榜;缺个引用,它顺手补一个格式完美但并不存在的 DOI。
文字变漂亮了,证据链却没有变完整。而综述被审稿人抓,抓的从来是证据链,不是文笔。
那为什么聊天框治不好这个病?三个死穴:
综述正文是万字级、跨几十份材料、要做几周的长程任务,聊天框是短程无状态的;
综述的生命线是可回溯(每句话都要能指回原文哪一页),聊天框的产物断了链;
综述是增量做出来的(今天加两篇,下周砍一节),聊天框每次都从零开始。
所以我后来把问题换了个问法:
不要先让 AI 写综述,而是让它先把综述变成一组可以检查的研究判断。
CODEX
二、为什么拿 Codex 举例
很多人对 Codex 的印象还停在“OpenAI 的写代码工具”,这个印象在 2026 年已经过时了。它现在是一整条产品线:桌面 App、命令行 CLI、IDE 扩展、云端任务,外加技能系统、分层指令文件(AGENTS.md)、定时自动化、子代理、MCP 外部工具接入。OpenAI 自己也在把它往“不止于软件开发的通用工作代理”上推。
但对写综述的人来说,真正有用的只有三件事,正好一一对上前面三个死穴:
① 它有文件系统 → 上下文不靠“记住”,靠“写下来”。你的综述项目从此不是一串对话,是一个工作区。上下文丢了没关系,文件还在。
② AGENTS.md → 把“项目宪法”一次写死。 Codex 启动时自动读取它作为项目指令,而且分层:全局一份、项目根一份,越靠近工作目录的优先级越高。导师的体例、你的禁令、引用格式、术语表全写进去,每次任务自动继承。
③ 可批处理 + 可 diff(配 Git)→ 增量、可回滚、可审计。你终于能回答“这句话是哪一版加的、依据是哪条来源”。
先说清楚:核心是流程,不是 Codex。Claude Code、Gemini CLI、Cursor 逻辑几乎一样,AGENTS.md / SKILL.md 现在基本已是跨工具通用格式。你换工具,下面 8 道工序一个字都不用改。
OVERVIEW
三、八道工序总览
唯一铁律:每道工序的产出必须落成文件,不能停留在对话里。
唯一顺序建议:S4 绝对不能跳。跳了它,S5 到 S8 做得再干净,出来的还是拼盘。
工作区长这样:
DEEP DIVE
四、逐道拆开
S1|任务契约:把“帮我写综述”翻译成可验收的任务
“帮我写一篇文献综述”不是一个完整任务。至少要先说清五件事:
|
|
|
|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
这里有个最常见的错误,值得单独说:很多人把“范围”当成了“问题”。
“【替换:某方向】的研究进展”——这不是问题,这是范围。范围只能生出目录,问题才能生出论证。
一份合格的契约长这样:
这一步的验收标准:拿任意一篇文献来,你都能说出它跟这个核心问题是什么关系。做不到,说明契约还没打磨好,别往下走。
S2|证据表:文献先进表,不进正文 ★
这是全流程的防幻觉主闸。
关键在于,让 AI 做的是抽取,不是总结:
总结 = 让 AI 决定什么重要 → 你得到一段没有信息密度的话,还没法核验。
抽取 = 你规定字段,AI 只负责填空 → 你得到结构化数据,每格都能查。
每篇论文先变成一行可追溯记录,最少这些字段:
|
|
|
|
|---|---|---|
| source_id |
|
|
| cite_key |
|
|
| research_question |
|
|
| method_family |
|
|
| population_dataset |
|
|
| reported_finding | 作者明确报告了什么 |
|
| limitations |
|
|
| verification_status | fulltext-checked
|
|
| locator |
|
|
这一步有个概念必须掰清楚,它是整套方法的地基:
作者报告 ≠ 当前材料支持 ≠ 独立复现。
论文里写“我们发现 X”,这只是作者报告。它进你的证据表时必须写成“作者报告 X”,不能写成“X 成立”。而“当前材料支持”是指:你手上这批笔记合起来,能支撑到什么程度。“独立复现”则是另一回事,绝大多数综述里你根本没做过。
这三样在 AI 笔下会自动融成一句“研究表明”。而审稿人最爱抓的就是这一句。
同理,fulltext-checked 只表示“这条记录能回到全文”,不表示你复现过实验。
S3|主题地图:从“论文顺序”切到“方法族与争论”
逐篇介绍论文,必然写成流水账。正文需要的是一个更高层的问题:这些研究在哪个维度上相同,又在哪个维度上分歧?
四种综合动作:
收敛:多项研究在相近条件下指向同一结论;
分歧:结果不同,原因可能来自数据、指标、窗口或设计;
演进:早期解决描述问题,后续转向机制解释或外部验证;
缺口:一个关键比较、样本、协议或机制长期没被补齐。
以演示主题为例,三篇论文从“谁先发表”改成三条路线:
通过 patch 或 token 改变输入表示;
通过分解或线性映射提供简单控制;
通过周期结构或二维重排建模多尺度变化。
换个学科也一样成立:教育领域可以是“三种对学习效果的归因路径”,临床可以是“三类对同一终点的测量口径”。变的是内容,不变的是“按争论组织,不按论文组织”。
S4|冲突图:拼盘和论述的分水岭 ★★
整篇文章你只记住这一节也够了。
上一步的收敛/分歧/演进/缺口,很多人当成四选一的标签打完就过。这是最大的浪费。“分歧”不该是主题地图里的一个字段,它值得一道独立工序、一份独立产物、一个独立的人工判断闸门。
因为综述的价值,几乎全部产生在分歧处。
产出 DISAGREEMENT_MAP.md:
为什么“归因”这栏必须留给你?
因为 AI 在这里有一个非常隐蔽、也非常致命的坏习惯:它太会和稀泥。
你让它比较两篇结论相反的文献,它十有八九给你这一句:
两项研究从不同角度提供了互补的视角。
这句话不夸大、不越界、不编造,任何引用审计都查不出问题——但它把综述最值钱的部分整个抹掉了。
注意,这跟“说过头”是两个方向相反的失败:说过头是把弱证据写强,和稀泥是把真冲突写没。大部分人只防前者,所以后者一路畅通到终稿。
AI 能帮你把冲突找出来,但只有你能解释冲突。这就是标题里“不许它写一个字”的意思——在这一道,让它列表,别让它写段落。
S5|主张台账:把要说的话拆成可审计的 claim
正文写作前,先把准备说的每句判断,变成一条能被单独审计的记录:
|
|
|
|
|
|
|
|
|
|---|---|---|---|---|---|---|---|
|
|
|
|
|
|
|
|
|
两组标签,别搞混:
evidence_strength(这条证据对这条主张的支持力度)
|
|
|
|---|---|
| strong |
|
| partial |
|
| background |
|
| contradictory |
|
status(这条主张目前的状态):verified(表述能回到来源且没超范围)/uncertain(证据不完整)/contested(来源之间有未解决的冲突)。
这里有个坑,我见过不止一版模板踩:evidence_strength 是相对于主张的,不是文献本身的属性。同一篇论文,对 CLM-001 可能是 strong,对 CLM-007 就只是 background。所以它属于主张台账,不属于证据表。放错地方,后面所有的强弱判断都会失真。
S6|两轮成文:先骨架,后正文
AI 写得像不像论文,往往不取决于模型多强,而取决于你给它的输入是不是“可写材料”。空白聊天框里只有主题,它只能用常识补缝;工作区里有证据表、冲突图、主张台账,它才能围绕既定判断组织语言。
第一轮只写骨架:每段的中心句、证据编号、比较维度、限制、过渡。不写完整 prose,不许润色。
第二轮才写正文,而且要“证据封锁”:只能用本段挂载的 source_id;每个可核查事实后保留 cite_key;不许引入台账之外的任何文献。
写出来应该长这样:
现有长期预测研究大致形成三条表示路径。第一类工作把连续序列切分为更适合建模的局部单元,第二类工作用低复杂度映射检验复杂结构是否带来额外收益,第三类工作显式编码多周期变化。三类方法的差异不只在网络组件,而在于它们对“长预测窗口中的有效结构”做出了不同假设。现有证据能够支持方法假设的横向比较,却还不足以在未对齐协议下给出统一排名,这也构成了后续实验需要补齐的比较条件。[SRC-001;SRC-002;SRC-003]
这段的骨架就是五句法:
先给出主题总判断;
放入两到四个代表性工作;
指定一个横向比较维度;
说清共同限制或分歧来源;
过渡到你的研究问题。
一段只服务一个中心判断。想同时讲历史、性能、机制和未来方向,先拆段。
至于英文论文:先用中文确认“要说什么”,再做英文转写。 直接让 AI 生成英文段落,逻辑越界会被漂亮的句式盖住。
S7|审计:三类问题一起查
初稿出来别只问“语言顺不顺”。真正有价值的第二问是:哪些内容超出了来源的支持范围?
|
|
|
|
|---|---|---|
|
|
cite_key
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 是否把冲突写成了互补 |
|
回 DISAGREEMENT_MAP 取归因,改写成条件性分歧 |
|
|
|
|
倒数第二行是我加的,也是最容易漏的一行。
问题按 P0(引用不存在/捏造,立即处理)到 P3(语气套话,最后统一润色)分级,先清 P0、P1 再谈润色。
举个例子,下面这句很像综述,但不够可靠:
这些方法都在多个任务上显著优于传统模型,证明了深度架构的普适优势。
审计后应该更窄:
在各自论文报告的实验协议下,不同方法分别展示了对特定任务或数据集的收益;由于预测窗口、数据划分和指标实现尚未逐项对齐,现有材料不能支持“普适优势”或跨论文统一排名的判断。
后一句不一定更有气势,但它经得起追问。综述的价值不是把所有论文都夸一遍,而是把证据之间的关系说清楚。
然后是这一节最重要的一句:
无论 AI 的审计报告跑得多干净,你必须亲自抽检。
具体做法:从审计判为“无问题”的条目里随机抽 20%(不是挑你有印象的),亲自打开原文,翻到 locator 那一页,自己判断这句话是否真的被支持。如果抽检中出现 1 条以上明确不支持,整轮审计作废,回 S2 检查证据表质量。
(20% 和“1 条”是经验值,不是什么标准,你按稿件重要性自己调——毕业论文和课程作业显然不该同一个阈值。)
为什么不能全交给 AI:同一个模型写的稿、同一个模型来审,它对自己那套表述天然更宽容。 这 20% 是整条流水线唯一的外部校准点。
S8|降 AI 味:只改语言,不动论点
最后一道才处理“读起来像不像人写的”。
硬约束:不改变任何研究判断、证据范围、数字、引用和限制;保留所有 cite_key、source_id 和 [VERIFY] 标记;保留条件性措辞(“在该研究协议下”“当前材料支持”)。
顺序不能反。先润色再核验,你会花大量时间打磨一段最终要被砍掉的话。
ROLES
五、谁干哪一段
|
|
|
你必须亲自干的 |
|
|---|---|---|---|
|
|
|
核心问题的最终判断 |
|
|
|
|
|
evidence_table.csv |
|
|
|
|
THEME_MAP.md |
|
|
|
★ 解释为什么打架 | DISAGREEMENT_MAP.md |
|
|
|
★ 决定说什么、不说什么 | CLAIM_EVIDENCE_LEDGER.md |
|
|
|
|
review_draft.md |
|
|
|
★ 随机抽检 20% | AUDIT_REPORT.md |
|
|
|
|
|
AI 承担的全是执行层,你承担的全是判断层。
这不是因为 AI 不够强,而是因为判断本来就是这篇综述的全部学术价值。如果判断也外包了,那这篇综述本身就没有存在的必要。
QUICKSTART
六、一小时跑通第一版
别一上来塞一百篇。先做小闭环:
第一遍大概率超时,这很正常——你在建的是一条以后能重复用的流水线,换主题、换论文、换章节都沿用同一组中间产物。第二次跑,时间会砍掉一半以上。
RED LINES
七、四条红线
① 学术诚信与披露。不同期刊、不同学校对 AI 辅助的政策差别很大且更新频繁,投稿前查目标期刊作者须知,毕业论文查你们学校当年规定。有一点是普遍共识:生成式工具不能列为作者,因为它无法对研究内容承担责任。
② 幻觉引文。不核验就投出去,赌的是你自己的学术记录。这类问题一旦被发现,杀伤力远超“写得不好”。
③ 数据安全。未发表数据、涉密材料、受伦理审批限制的原始资料,不要往云端传。要用就用本地模式,并确认沙箱与权限设置。合作项目事先跟合作方讲清楚。
④ 别让它替你读文献。证据表是给你读的加速器,不是替你读的替身。你对一个领域的“手感”——哪个组做事靠谱、哪篇方法有硬伤、哪个结论大家嘴上认心里不认——不在任何一篇 PDF 里。省掉这一步,你能交出一篇合格的综述,但你不会因此成为这个领域的内行。
EPILOGUE
结语
这套流程真正改变的,其实不是“写得更快”。
是它把一件模糊的、无限期的、随时可以拖延的事(“我要写文献综述”),变成了八件边界清楚、有验收标准、每件都能在一两小时内做完的事。
写不动,往往不是因为难,是因为看不见“做完”长什么样。
顺序其实只有一句话:
先收证据,再做综合;先找分歧,再定主张;写完审计,最后由作者定稿。
TOOLKIT
配套福利包
这篇讲的是为什么,福利包给的是怎么做——全套可直接复制的物料:
《AI 辅助文献综述正文流水线 · 全套工具包 》
✅ 工作区目录结构 + 一键创建脚本(Mac / Windows 双版本)
✅ AGENTS.md 项目宪法模板(含证据边界与禁令清单)
✅ 八道工序完整提示词 S1–S8(每条含目标、输入、输出、验收标准)
✅ 证据表模板 + 字段字典 + 三级核对状态说明
✅ 冲突图模板(含人工判定栏)
✅ 主张—证据台账模板 + 两组标签的判据
✅ 段落五句法检查卡 + 可替换骨架
✅ 审计提示词(含反“和稀泥”检查项)+ P0–P3 分级 + 20% 抽检规程
✅ 降 AI 味提示词(只改语言不改论点)
✅ 发布前最终清单 + 常见 9 个坑
✅ 学术诚信声明模板(中英双语)
✅ 一页速查表
如果你也想把"读过很多论文"变成"写得出有证据的综述",后台回复关键词「B791」,添加小助理领取这套工具包:8 组可复制提示词、证据表、冲突图、主张台账、段落五句法和发布前审计清单。
END
想要更多AI使用技巧?回复关键词
B655:nature-skill功能测试
B675:Codex 使用前必做的几个设置:配置、权限和 Skill 一次讲清楚
F424:科研写作与绘图 Skills 汇总推荐
科研小白需安装的 11 个 SKills
B678:文献下载管理与综述Skill安装包:literature-review-workflow
B685:创新点设计与可证伪性检验Skill安装包:paper-novelty-design
B716:Zotero + Obsidian + Codex 联动教程
B719:GPT-5.6-Sol-实战指南
B721:GPT5.6 安装指南和必装skill
B740:GPT做PPT-全流程提示词模板(异常好用)
B754:drawio绘图软件、skill和插件安装包

