摘要
尽管大语言模型广泛应用于开放域问答,但其处理需推导而非直接检索的推断性问题能力尚待探索。本研究 investigates 段落结构与质量对模型性能的影响,提出“收敛性”指标,衡量句子消除错误答案的有效性。基于 TriviaHG 数据集子集构建不同收敛水平的段落,评估六种模型。结果显示,高收敛性句子构成的段落显著优于余弦相似度筛选方法,且按收敛性降序排列可进一步提升性能。研究表明收敛性是指导段落构建及分析推断推理行为的有效信号。
AI 推荐理由
研究聚焦于推断性问答,通过上下文收敛性提升推理能力,是核心应用场景。
研究机构
University of Innsbruck
论文信息