第二部分:真实 RAG 测试
-
第一轮抽到了开头的谜题设定和两个朴素假设。 -
第二轮抽到了电网级联和时序敏感性章节。 -
第三轮抽到了祖父悖论对比和混沌放大论证。 -
第四轮就有意思了:检索抽到了记忆和 “天主之像” 章节的片段,不是诺维科夫相关的段落。
-
第一轮问物理一致性,检索到对应片段。 -
第二轮问哥德尔,检索哥德尔章节。 -
第三轮问记忆,检索到的内容讲一致性的时候,很容易跨层面,因为记忆章节本身就同时联系了物理和逻辑层面来论证。
-
对话 B 丢分是因为混淆了相似但不同的概念,是精准性问题,根源是文章用跨层面类比做论证的方式 -
对话 C 丢分是因为文章用了委婉表述,模型说得更直接,是语气问题,根源是模型对文章结论的力度判断偏强
结果解读
核心测试发现
-
忠实度告诉你模型说了哪些检索内容里没有的话。 -
精准性告诉你最相关的片段有没有排在前面。 -
召回率告诉你该找的片段有没有都找到。 -
相关性告诉你检索出来的内容有多少噪音。 -
G-Eval 告诉你模型有没有尊重文档的论证。 -
完整性告诉你对话有没有达成用户目标。 -
语义精准性告诉你轮次之间有没有守住区分。 -
认知谦逊性告诉你文档的语气有没有保留。
E n d

