摘要
多跳问答是生物医学领域的重大挑战,需整合多源信息以回答复杂问题。BioCreative IX MedHopQA 共享任务旨在基准测试大语言模型的多跳推理能力。本研究构建了包含 1000 个高难度问答对的新数据集,涵盖疾病、基因和化学物质,特别关注罕见病,每个问题均需通过整合两个不同维基百科页面的信息进行两跳推理。评测结果显示,检索增强生成(RAG)策略对提升性能至关重要,顶级系统在概念准确率上显著优于零样本基线。该数据集已公开,以推动该领域持续进步。
AI 推荐理由
论文核心聚焦多跳推理挑战,构建数据集并评估 LLM 在生物医学领域的复杂推理能力。
研究机构
National Library of Medicine (NLM), National Institutes of Health (NIH), MD, 20894, Bethesda, USA
论文信息