摘要
尽管数值推理是大语言模型数学能力的基石,但现有基准测试鲜少整合数值处理与数学推理,阻碍了对数学任务失败原因的解释。本文提出 PyraMathBench,一个包含 32,505 个问题的综合分层基准,涵盖 4 个认知维度、14 个子类别及 2 种模态。实验表明,LLM 性能受限于数值计算不足及抽象数值问题处理能力弱。为此,我们提出基于智能优化与学习的通用模块(SOLVE)及交互式相对策略优化(IRPO),通过高效工具调用增强数值 - 数学协同能力。对比实验显示,经 SOLVE 和 IRPO 训练后,Qwen-2.5 得分提升 5.0。
AI 推荐理由
论文核心聚焦于提升 LLM 的数值处理与数学推理协同能力,属于推理能力研究。
研究机构
East China Normal University
Hasso Plattner Institute, University of Potsdam
论文信息