procedural execution diagnostic benchmark faithful instruction following arithmetic reasoning failure analysis
摘要

大语言模型在推理基准测试中常表现优异,但最终答案准确率无法反映其是否忠实执行了提示中的程序。本研究通过一个受控的程序执行诊断基准探讨该问题,要求模型根据给定的分步算术算法和数值输入返回计算结果。基准虽使用简单算术,但通过增加算法长度和中间变量的回溯依赖来提升复杂度。实验涵盖 14 个模型和 55 个数据集,结果显示平均首答准确率从 5 步程序的 61% 降至 95 步程序的 20%。生成级分析表明,失败常涉及缺失答案、过早回答、错误后自我修正、执行轨迹不足及幻觉额外步骤。这些发现暗示,表面的推理能力可能掩盖了指令执行方面的重大缺陷。

AI 推荐理由

论文核心研究 LLM 在执行多步算术程序时的推理忠实度与失败模式,直接关联推理能力。

研究机构
Indian Institute of Technology Gandhinagar Soket AI
论文信息
作者 Sailesh Panda, Pritam Kadasi, Abhishek Upperwal, Mayank Singh
发布日期 2026-05-01
arXiv ID 2605.00817
相关性评分 9/10 (高度相关)