摘要
本文提出 StepGap,一种混合自然语言推断(NLI)与大语言模型(LLM)的决策树,旨在检测多跳问答中的逐步证据缺口,并输出三种带类型的标签(矛盾主张、无关证据、缺失桥梁),每种标签对应具体的修复动作。实验表明,StepGap 在逐步评估指标上优于纯 LLM 基线,且结构更具可分解性,避免了误差抵消问题。此外,文章揭示了问答级指标的计算陷阱,强调逐步评估的必要性。作为强化学习的过程奖励,StepGap 显著提升了 Qwen2.5-7B 模型的精确匹配率。
AI 推荐理由
论文核心研究多跳问答中的逐步推理验证、证据缺口检测及逻辑错误分类,直接提升推理能力。
研究机构
School of Computing and Information, University of Pittsburgh
论文信息