Self-Play Knowledge Graph Multi-hop Reasoning Reinforcement Learning
摘要

针对科学文献中多模态元素关系隐式导致推理问题生成难及奖励信号弱的问题,本文提出 SPARK 框架。该框架自动构建统一知识图谱,利用其路径生成关系推理问题,并基于结构化事实计算可验证奖励。小型视觉语言模型在信息不对称下交替扮演提议者与求解者进行自博弈。实验表明,SPARK 在多跳问答任务上显著优于基于扁平语料的基线,且随跳跃次数增加优势扩大,证实了知识图谱结构对关系多跳推理的关键作用。

AI 推荐理由

论文核心在于利用知识图谱结构增强多跳关系推理能力,显著提升复杂推理任务表现。

研究机构
ANTLAB, South Korea Hanhbat National University, South Korea
论文信息
作者 Hyobin Park, Taeseop Kim, Dong-Geol Choi
发布日期 2026-05-07
arXiv ID 2605.05546
相关性评分 9/10 (高度相关)