你好,我是方可乐。
一个从Java开发成功转型,聚焦 AI 编程、AI 应用和智能体开发的 AI 应用开发工程师。
今天在AI成长圈群里,一个正从java转行的朋友问我:在RAG中,PDF 跨页怎么切?召回怎么拼出正确答案?
我没直接回答。
我说你先换个思路——当下,我们是否需要硬规则或者算法去切?
硬规则,是省 token 的妥协,不是最优解
以前模型贵,一个 token 都精打细算,所以只能靠算法:按页切、按标题切、去掉页眉页脚。这些规则看着严谨,本质是在省钱,不是让内容被理解得更好。
现在 deepseek 跟不要钱一样,1M 上下文往那一放,整个 PDF 直接丢给模型,让它自己按语义做最优切割——比任何规则都切得准。
切片只是手段,目的是让模型理解内容。
模型自己能理解了,规则就不重要了。
但切片只是第一环,别只盯它。
一个完整的 RAG 链路是:问题改写/拆分 → 切片 → 检索召回 → 拼上下文 → 生成。切片只是其中一环。
很多人一上来就扎进切片和调参里,连链路都没跑通,顺序就反了。
问题改写必须做:你要支持口语化聊天问答,用户说"那个啥咋用",文档里写的是"功能说明"。不改写,检索就是废的。改写的提示词要沉淀下来,你的知识版图才巩固。
召回怎么拼?我觉得暂时能跑就行
你想知道怎么保证召回能拼接出正确答案?
——我的答案可能让你失望:别指望一上来就拼得完美。
关键字、向量相似度、重排,还有一堆权重阈值,看着玄,但数据量没上来,调了也看不出效果。
真不准了,再针对高频出问题的场景,单点优化。
时代变了,算法让位给模型。
与其纠结切分规则,算法,参数细节,不如先把链路跑通
——真出了问题,再回来调。这比收藏一堆切分方案高效得多。
面试也一样:别背切片规则。
你实践过、有数据、能说清楚为什么这么切,比记住一堆参数强得多。

