inferential reasoning context construction question answering LLM evaluation
摘要

尽管大语言模型广泛应用于开放域问答,但其处理需推导而非直接检索的推断性问题能力尚待探索。本研究 investigates 段落结构与质量对模型性能的影响,提出“收敛性”指标,衡量句子消除错误答案的有效性。基于 TriviaHG 数据集子集构建不同收敛水平的段落,评估六种模型。结果显示,高收敛性句子构成的段落显著优于余弦相似度筛选方法,且按收敛性降序排列可进一步提升性能。研究表明收敛性是指导段落构建及分析推断推理行为的有效信号。

AI 推荐理由

研究聚焦于推断性问答,通过上下文收敛性提升推理能力,是核心应用场景。

研究机构
University of Innsbruck
论文信息
作者 Jamshid Mozafari, Bhawna Piryani, Adam Jatowt
发布日期 2026-05-12
arXiv ID 2605.12370
相关性评分 8/10 (高度相关)