Reasoning Benchmark STEM Evaluation Multi-step Reasoning Error Analysis
摘要

本文介绍了 CFE,一个涵盖 20 多个 STEM 领域的多模态基准,旨在评估大语言模型的推理能力。该基准由真实的大学作业和考试题及教师提供的参考解答构成。实验显示,即使是前沿模型在此基准上也面临巨大挑战。通过分解参考解答为推理流进行的诊断分析发现,模型虽能正确回答中间子问题,但难以在多步求解中可靠地推导和维持正确的中间状态。此外,模型生成的解答通常比教师解答步骤更多,表明其步骤效率低下且错误累积风险较高。

AI 推荐理由

论文核心是评估 LLM 推理能力的基准,深入分析多步推理中的状态维持与错误积累问题。

研究机构
西北大学 圣塔克拉拉大学 杜克大学 伯明翰大学 罗切斯特大学 Analog AI, Inc.
论文信息
作者 Chongyang Gao, Diji Yang, Shuyan Zhou, Xichen Yan, Luchuan Song et al.
发布日期 2026-02-23
arXiv ID 2602.19517
相关性评分 9/10 (高度相关)