数学推理 基准测试 工具增强 数值计算
摘要

尽管数值推理是大语言模型数学能力的基石,但现有基准测试鲜少整合数值处理与数学推理,阻碍了对数学任务失败原因的解释。本文提出 PyraMathBench,一个包含 32,505 个问题的综合分层基准,涵盖 4 个认知维度、14 个子类别及 2 种模态。实验表明,LLM 性能受限于数值计算不足及抽象数值问题处理能力弱。为此,我们提出基于智能优化与学习的通用模块(SOLVE)及交互式相对策略优化(IRPO),通过高效工具调用增强数值 - 数学协同能力。对比实验显示,经 SOLVE 和 IRPO 训练后,Qwen-2.5 得分提升 5.0。

AI 推荐理由

论文核心聚焦于提升 LLM 的数值处理与数学推理协同能力,属于推理能力研究。

研究机构
East China Normal University Hasso Plattner Institute, University of Potsdam
论文信息
作者 Zetian Ouyang, Linlin Wang, Gerard de Melo, Liang He
发布日期 2026-06-02
arXiv ID 2606.03858
相关性评分 9/10 (高度相关)