导读
向大模型提问"Lasha Talakhadze 之前的奥运举重纪录是多少”,模型往往能识别实体却给出当前纪录,忽略了“之前”这一时间约束。这并非个别模型的缺陷,而是基于知识图谱的问答系统普遍存在的结构性痛点:看得见实体,看不见时间。
针对这一难题,北京航空航天大学、复旦大学与浙江大学联合团队在 AAAI 会议上提出了 QC-MHM(Question Calibration and Multi-Hop Modeling)框架。该方案通过问题校准、时序嵌入与多跳图推理三大核心模块,赋予模型真正的“时间感”,在时序知识图谱问答任务中实现了性能突破。
作者单位:北京航空航天大学·复旦大学·浙江大学
发表会议:AAAI(CCF-A 类顶会)
背景:时序问答的痛点与挑战
场景与核心难点
时序知识图谱问答(Temporal KGQA)的核心任务,是给定带时间约束的自然语言问题,从知识图谱中精准定位落在正确时间窗口内的答案。与传统 KGQA 相比,其难度呈指数级上升。
例如,知识图谱中可能同时存在“(布达佩斯,市长,A,1992)”和“(布达佩斯,市长,B,2024)”两条事实。传统模型极易混淆时间维度,在回答"1992 年谁是市长”时错误地输出 2024 年的信息。
现有方法的两大硬伤
尽管学界已提出 CronKGQA、TMA 等模型,但均未能根本解决以下两个问题:
1. 预训练语言模型(PLM)对时间“视而不见”
Bert 等模型在编码问题时,注意力机制天然聚焦于实体名词,对“之前”、“期间”等时间词汇缺乏敏感性,导致模型实质上是在处理一道缺失时间约束的问题。
2. 图结构信息利用率低
多数方法仅将知识图谱作为索引库,未充分利用其中的多跳关系结构。面对需要两步以上推理的复杂问题,模型表现不佳且推理过程如同黑箱。
QC-MHM 解决方案概览
QC-MHM 构建了一个端到端框架,串联起三个关键模块:
- 时序感知嵌入:让知识图谱中的时间戳具备前后顺序概念。
- 问题校准:引导问题向量主动在图谱中检索时间线索,并据此更新自身表示。
- 多跳 GNN 推理:单层网络即可访问任意跳邻居,并输出可解释的推理路径。
技术方案详解
模块一:赋予时间戳“顺序感”的 KG 嵌入
知识图谱事实通常表示为(主体,关系,客体,时间)四元组。QC-MHM 采用 TComplEx 作为基础嵌入模型,但针对其无法区分时间先后的问题,引入了类似 Transformer 的正弦位置编码,为每个时间戳叠加位置信息。
随后,通过正弦编码增强时间表示:

模型还构造了辅助任务,专门训练其判断“时间 m 是否早于时间 n"的能力:


总训练损失函数如下,该辅助任务如同专项训练,确保在嵌入空间中 1992 年的向量自然位于 2024 年之前:

模块二:问题校准——主动检索时间线索
这是 QC-MHM 的创新核心。不同于常规的“问题编码后直接查询”,该模块让问题向量先在知识图谱中检索与时序相关的 SPO(主体 - 关系 - 客体)三元组,再反向修正自身表示。
第一步:候选 SPO 召回
利用 SentenceBERT 分别编码问题和图谱中的所有 SPO,通过余弦相似度排序,保留 Top-10 候选:

第二步:三注意力多视角匹配
采用三种注意力机制并行比较“问题词”与"SPO 候选”:

三种视角分别关注向量拼接的合理性、关键维度的对齐度以及差异点,全方位捕捉语义关联。
第三步:门控自适应融合
模型自动权衡“原始问题语义”与“检索到的时序信息”的权重:

经过校准的问题向量从此具备“时间感”,将模糊的"XXX 是谁”转化为精确的"XXX 在 1992 年是谁”:

模块三:单层多跳 GNN 推理
传统 GNN 需堆叠多层才能覆盖多跳邻居,效率低且难以解释。QC-MHM 采取“子图裁剪 + 一次性多跳聚合”策略。
子图裁剪:以问题实体为起点,抽取 k 跳范围内的子图,缩小搜索空间。
路径打分与聚合:通过注意力矩阵计算路径得分,并利用加权和将 1 跳至ℓ跳的注意力矩阵合并,使单层 GNN 即可访问任意跳邻居:


经验表明,设置特定参数即可取得理想效果。最终生成的图向量不仅用于预测,其注意力权重还可可视化,清晰展示模型的推理轨迹:

模块四:双通道答案预测
将校准后的问题语义向量与 GNN 聚合后的图向量拼接,经 Transformer 融合后,分别投影至实体空间和时间戳空间,利用 TComplEx 评分进行双通道预测:


双通道分数经 Softmax 处理后通过交叉熵优化,使同一模型能同时胜任“是谁”和“何时”两类问题的回答:

实验结果与分析
CronQuestions:逼近性能天花板
- 在复杂多跳问题上,Hits@1 绝对提升 5.1%,Hits@10 提升 1.2%。
- 在实体型答案与时间型答案两条赛道上均取得最优表现。
- 整体 Hits@1 达到 0.971,接近该数据集的性能上限。
TimeQuestions:跨数据集泛化验证
迁移至 TimeQuestions 基准测试同样获得 SOTA 结果,证明该方法具有良好的泛化能力,而非针对特定数据集的过拟合方案。
细粒度问题类型拆解
在"Before-After"等典型时间排序问题上,QC-MHM 优势尤为显著。这得益于“问题校准”模块显式建模了时间约束,使模型能准确理解“之前”的语义。
消融实验:三件套缺一不可
实验显示,移除任一模块都会导致特定类型问题性能大幅退化,证明三个模块相互协同,构成了有机整体。
可视化:“白盒”推理路径
模型能够清晰展示在图谱中的逐跳推进过程及高权重激活边,打破了以往的黑箱模式。
图中高亮的数值(如 92%、95%)证实了门控机制能有效捕捉关键时序 SPO。梯度分析进一步印证,问题校准模块成功将关键时序事实映射到了问题向量中。
项目价值与应用前景
学术贡献
- 首创“问题校准”机制:结合多视角注意力与门控融合,使 PLM 编码的问题向量能主动从 KG 提取时序知识,根治“时间盲区”。
- 单层多跳聚合:通过加权组合实现单层 GNN 访问任意跳邻居,兼顾效率与可解释性。
- 顺序感知嵌入:引入时间先后判断作为辅助监督信号,隐式编码时间序列信息。
落地应用场景
- 搜索引擎:精准应答含“之前”、“期间”、“最早”等时间限定词的复杂查询。
- 金融合规:跨时间维度追踪股权变更、监管事件及诉讼时序。
- 医疗药学:梳理疾病演进、用药历史及临床试验时间线。
- 档案管理:实现跨年代事件的因果关联推理。
- 企业 BI:基于时间链路的趋势分析与因果推断。
在大语言模型强调“事实可追溯”的当下,QC-MHM 所代表的"PLM×时序 KG×多跳 GNN"技术路线,为构建可信的时序推理系统提供了关键解决方案。
论文(arXiv):https://arxiv.org/abs/2402.13188
代码(GitHub):https://github.com/zhouyan0614-sys/QC-MHM-TKGQA

