强化学习与知识图谱的融合,是当下智能决策领域破解泛化不足、常识缺失痛点的核心研究方向,近年顶会顶刊成果密集产出。
本文整理了10篇强化学习+知识图谱相关的最新前沿论文,正在做相关课题的伙伴可以直接下方领取论文及代码(部分包含),搭基线、找改进点、扩实验方向都能直接用上。
长按识别下方二维码,回复【强化图谱】
无偿领全部论文合集及项目代码
KG-Hopper: Empowering Compact Open LLMs with Knowledge Graph Reasoning via Reinforcement Learning
通过强化学习赋能轻量开源大模型实现知识图谱推理
文章内容
针对知识库问答中分步推理易出现误差累积、路径僵化的问题,提出基于强化学习的KG-Hopper框架,将完整多跳知识图谱推理过程嵌入单轮大模型的“思考”阶段,实现跨步骤依赖的全局推理与动态回溯探索。框架采用冷启动监督微调+GRPO强化学习的两阶段训练,搭配检索、格式、推理、答案四维复合奖励函数引导推理行为。在8个基准数据集上,7B参数模型性能超越最大70B的多步系统,比肩GPT-3.5-Turbo等闭源模型,且保持轻量、开源与数据高效的特性。
Plan Then Retrieve: Reinforcement Learning-Guided Complex Reasoning over Knowledge Graphs
先规划后检索:强化学习引导的知识图谱复杂推理
文章内容
针对现有知识图谱问答方法默认图谱完备、缺乏全局规划与自适应检索调度的局限,提出Graph-RFT两阶段强化微调框架。第一阶段通过定制化规划-检索思维链数据集进行监督微调,激活模型规划推理能力并解决GRPO冷启动问题;第二阶段引入笛卡尔式问题分解、多工具协同检索与多维度奖励机制,实现知识图谱与网页搜索的自适应调度。实验显示,7B基座模型在多组基准上超越GPT-4等基线,在图谱不完备场景下性能优势更突出。
TKG-Thinker: Towards Dynamic Reasoning over Temporal Knowledge Graphs via Agentic Reinforcement Learning
基于智能体强化学习的时序知识图谱动态推理
文章内容
针对时序知识图谱问答中现有方法易产生时序推理幻觉、静态工作流自主性与泛化性不足的问题,提出TKG-Thinker智能体框架。框架采用监督微调冷启动+在线强化学习的双阶段训练范式,构建包含多类时序检索工具的动作空间与多维度奖励机制,让模型通过“思考-行动-观察”循环自主完成时序推理。在多个基准数据集上,多款开源小模型均取得最优性能,在复杂多跳时序问题上提升显著,同时具备良好的跨域泛化能力。
↓↓听说在下方一键三连的都Accept了🌝

