摘要
现有自动科学问题生成研究多集中于单文档事实型问答,忽视了科学理解至关重要的跨文档推理。本文提出 AIM-SciQA,一个用于生成多文档、多跳科学问答数据集的自动化框架。该框架利用大语言模型提取单跳问答,基于嵌入的语义对齐构建跨文档关系,并选择性利用引用信息。应用于 8211 篇 PubMed Central 论文后,生成了包含 41 万余单跳和 1.3 万余多跳问答的 IM-SciQA 数据集。验证结果表明其具有高事实一致性,能有效区分检索与问答阶段的推理能力,为检索增强型科学推理提供了真实可解释的基准。
AI 推荐理由
论文核心在于构建跨文档多跳推理数据集,旨在评估和提升科学领域的复杂推理能力。
研究机构
延世大学, 首尔, 韩国
论文信息