大数跨境

IBM新RAG神器STAIR:用目录当地址,幻觉率<0.05%,Recall@1飙至82.6%!

IBM新RAG神器STAIR:用目录当地址,幻觉率<0.05%,Recall@1飙至82.6%! AI顿悟涌现时
2026-09-08
3
导读:传统RAG切块丢掉文档结构?IBM用目录重做生成式检索,效果直接起飞:STAIR vs DSI:82.6% vs 76.9%,BM25只有59.5%,幻觉几乎为零

幻觉率杀到0.05%

广大AI互联网终于不胡说八道了

🌊 AI搜索和AI写作的生成质量一直备受诟病!背后的核心问题,就是RAG检索增强生成技术的recall太差!

RAG最大的问题就是在把文档知识向量化结构化的过程中,操作过于生硬,大规模丢失文档知识的上下文语义。而增加上下文规模的解决方案,又会引发梯度爆炸,导致整个系统不可用!

怎么办?

IBM搞了个大新闻。

IBM团队扔出一篇叫STAIR(STructure Aware Information Retriever)的论文,直接把最让人头疼的“切块丢失文档结构”问题给解决了。核心思路简单粗暴又优雅:别再傻傻按长度切文档了,直接把现成的目录(Table of Contents)当成检索的地址空间

结果呢?在他们新搞的SearchTome基准上,Recall@1直接干到82.6%,比微调后的Differentiable Search Index(DSI)高了将近6个百分点(76.9%),统计显著;BM25只有59.5%,DPR是68.7%。更炸的是,幻觉率压到低于0.05%——这基本把生成式检索最被人诟病的“胡编乱造”给摁死了。

为什么目录比切块香?

传统RAG retriever最常见的做法是:长文档按固定token数硬切。切完之后,原本好好的章节层级、标题语义、上下文连贯性全没了。结果就是一堆语义碎片互相抢戏,检索质量上不去,幻觉也跟着来。

STAIR反其道而行。它把整本书的目录当作“全局地址簿”,让大模型直接把知识存进自己的参数里,然后用目录条目当生成式检索的输出目标。简单说,就是让模型像人翻书一样:先看目录,快速定位到“第几章第几节”,再去拿内容。

论文里有个很形象的例子:问“什么是plurality voting system?”人一看目录,马上能缩小到“Democracies and Democratization”→“Institutions within Democracy”→“Electoral Systems & Political Parties”。STAIR就是把这个人类直觉变成了模型能力。

SearchTome:给ToC检索量身定做的新基准

为了验证这套思路,团队专门搞了个多领域基准SearchTome。从Open Textbook里挑了18本真实书籍,覆盖教育、金融、法律、医学、自然科学、社会科学6大领域。每本书都把目录干净地解析出来,并映射到对应章节内容,同时生成了大量带金标准目录条目的问答对。

这玩意儿目前几乎是唯一真正带干净全局结构视图的长文档检索评测集。之前那些长上下文benchmark要么只测生成、要么没有结构信息,根本没法专门评估“用目录检索”这件事。

关键亮点:低幻觉 + 小样本泛化

消融实验特别有意思。加了目录之后,生成式检索的幻觉率直接掉到接近零(<0.05%)。没有目录的DSI虽然也能存知识,但结构要靠模型自己从训练数据里“猜”,幻觉和错误地址就多了。

另外,即使某些叶子节点训练样本极少,STAIR也能保持高准确率。这说明目录提供的显式层级结构,大大降低了模型学习的难度——它不用从头发现文档组织方式,只要学会“对着目录找地址”就行。

基础模型用的是Mistral Instruct v0.2,经过指令微调后就能稳稳输出正确的叶子节点标题。整个过程把“模型参数当索引 + 真实文档结构当地址空间”结合得相当漂亮。

结构,才是RAG下一阶段的关键杠杆

现在大家都在卷embedding模型、重排、混合检索、Agentic RAG……但很多时候,底层数据本身的语义边界和层级信息被粗暴切碎了,再强的模型也是在废墟上跳舞。

STAIR给了我们一个很清晰的提醒:文档本来就有结构,为什么非要扔掉?

企业知识库、产品手册、技术报告、合规文档、教科书……这些地方目录/大纲几乎是标配。把ToC(或者类似的层级元数据)直接喂进生成式检索器,比盲目追求更长上下文、更复杂的chunk策略,可能见效更快、幻觉更少。

当然,这不是银弹。现实世界里很多文档目录不完整、格式混乱,或者根本没有明确ToC。如何自动构建可靠的结构视图,以及如何把这套思路扩展到非书籍类长文档,还有很多工程和算法问题要解决。

但方向已经很清楚了: 
从“切碎再拼”转向“尊重原生结构”。

生成式检索(Generative Retrieval)本来就很有潜力,缺的就是一个靠谱的、低幻觉的地址空间。STAIR用最朴素的目录,把这个缺口补上了一大块。

论文已经挂在arXiv上了(2609.03874),代码和SearchTome基准也准备开源。建议所有做RAG的同学都去认真读一读,尤其是消融那部分。

结构,真的很重要。 
有时候,最聪明的创新,就是把人类早就在用的东西,认真交给模型。

文末点击下一篇或者扫码加入学习群,即可学习前沿AGI常识。

了解更多前沿AI?可以关注AI顿悟涌现时,持续了解。


欢迎大家关注AI顿悟涌现时,快速入门当下最热的AI大模型前沿。

原来人类的本质就是AGI
不用看数字的数学,让人高兴 人类大脑真是个奇迹

AI顿悟涌现时推出了【AGI常识】专题。【AGI常识】专题会以最通俗易懂的解释,帮你在一分钟内学会一个新技术名词背后的原理。欢迎点击下方动图,持续关注。

AI顿悟涌现时

AI顿悟涌现时绿旗下关注新技术的内容品牌。
AI顿悟涌现时关注前沿技术的发展应用,深度解读新技术对商业模式和社会形态的变革
大模型商业技术及通识,筹备开课,欢迎有授课能力的朋友合作,欢迎有兴趣的朋友报名一起学习。相关优质内容将会发布在下方动图内微信公众号▼▼
关注AGI ▶▶学习直达▶▶

【声明】内容源于网络
0
0
AI顿悟涌现时
全网唯一零门槛大模型科普!GenAI生成式大模型重塑互联网,世界模型重塑现实世界,硅基生命改写宇宙……人工智能与AR/MR/XR计算机合流,元宇宙虚拟世界开启超越实物价值。人类历史正在被int8和FP16量化卷积训练推理……
内容 97
粉丝 0
AI顿悟涌现时 全网唯一零门槛大模型科普!GenAI生成式大模型重塑互联网,世界模型重塑现实世界,硅基生命改写宇宙……人工智能与AR/MR/XR计算机合流,元宇宙虚拟世界开启超越实物价值。人类历史正在被int8和FP16量化卷积训练推理……
总阅读372
粉丝0
内容97