multi-hop reasoning biomedical QA RAG dataset benchmark
摘要

多跳问答是生物医学领域的重大挑战,需整合多源信息以回答复杂问题。BioCreative IX MedHopQA 共享任务旨在基准测试大语言模型的多跳推理能力。本研究构建了包含 1000 个高难度问答对的新数据集,涵盖疾病、基因和化学物质,特别关注罕见病,每个问题均需通过整合两个不同维基百科页面的信息进行两跳推理。评测结果显示,检索增强生成(RAG)策略对提升性能至关重要,顶级系统在概念准确率上显著优于零样本基线。该数据集已公开,以推动该领域持续进步。

AI 推荐理由

论文核心聚焦多跳推理挑战,构建数据集并评估 LLM 在生物医学领域的复杂推理能力。

研究机构
National Library of Medicine (NLM), National Institutes of Health (NIH), MD, 20894, Bethesda, USA
论文信息
作者 Rezarta Islamaj, Joey Chan, Robert Leaman, Jongmyung Jung, Hyeongsoon Hwang et al.
发布日期 2026-05-12
arXiv ID 2605.12313
相关性评分 9/10 (高度相关)