mathematical reasoning retrieval benchmark tool use research assistant
摘要

大语言模型在封闭世界数学推理中表现优异,但研究辅助需基于文献的工具使用。本文提出 Re$^2$Math 基准,评估从部分证明中进行工具导向检索的能力。该任务要求识别现有工具、定位学术来源并验证假设一致性。实验显示,尽管系统能检索有效陈述,但确立其在局部证明步骤中的适用性仍是难点(最佳准确率仅 7.0%)。该基准通过解耦引用召回、基础 grounding 和证明缺口充分性,将文献支持的数学工具使用转化为可控诊断任务。

AI 推荐理由

论文聚焦于数学研究中工具(引理/定理)的检索与适用性验证,属于高级技能学习范畴。

研究机构
复旦大学 南京航空航天大学
论文信息
作者 Zicheng Lyu, Wenjie Yang, Shengzhong Zhang, Zengfeng Huang
发布日期 2026-05-09
arXiv ID 2605.09012
相关性评分 8/10 (高度相关)