摘要
大语言模型在封闭世界数学推理中表现优异,但研究辅助需基于文献的工具使用。本文提出 Re$^2$Math 基准,评估从部分证明中进行工具导向检索的能力。该任务要求识别现有工具、定位学术来源并验证假设一致性。实验显示,尽管系统能检索有效陈述,但确立其在局部证明步骤中的适用性仍是难点(最佳准确率仅 7.0%)。该基准通过解耦引用召回、基础 grounding 和证明缺口充分性,将文献支持的数学工具使用转化为可控诊断任务。
AI 推荐理由
论文聚焦于数学研究中工具(引理/定理)的检索与适用性验证,属于高级技能学习范畴。
研究机构
复旦大学
南京航空航天大学
论文信息