摘要
针对代理式知识图谱问答(KGQA)中训练数据稀缺及推理泛化难的挑战,本文提出 GraphWalker 框架。该方法采用两阶段监督微调范式:首先利用约束随机游走生成的结构化多样轨迹进行训练,建立广泛的探索先验;随后在少量专家轨迹上微调,培养反思与纠错能力。实验表明,该范式显著提升了轻量级强化学习的效果,在 CWQ 和 WebQSP 数据集上达到最先进水平,并增强了对分布外推理路径的泛化能力。
AI 推荐理由
论文核心解决 KGQA 中的推理泛化问题,通过合成轨迹训练提升多步推理与错误恢复能力。
研究机构
中国科学院自动化研究所
中国科学院大学人工智能学院
论文信息