摘要
本文提出 ToolMATH,一个基于数学的基准,用于评估语言模型在真实多工具环境中的表现,重点关注模式指定工具调用及多步执行维持能力。该基准将数学问题转化为可控且可验证正确性的任务,系统评估模型在大型重叠工具目录及目标能力缺失情况下的可靠性。评估显示,关键失败因素在于推理能力不足,导致中间结果错误累积并制约后续决策。工具冗余不仅增加噪声,更会放大早期偏差引发不可逆的执行漂移。研究强调,提升性能关键在于长程计划的一致性及对观察结果的规范使用,而非局部动作选择。
AI 推荐理由
论文核心评估多工具环境下的长程推理能力,指出推理失败是主要瓶颈。
研究机构
韩国科学技术院
论文信息