摘要
本文介绍了 CFE,一个涵盖 20 多个 STEM 领域的多模态基准,旨在评估大语言模型的推理能力。该基准由真实的大学作业和考试题及教师提供的参考解答构成。实验显示,即使是前沿模型在此基准上也面临巨大挑战。通过分解参考解答为推理流进行的诊断分析发现,模型虽能正确回答中间子问题,但难以在多步求解中可靠地推导和维持正确的中间状态。此外,模型生成的解答通常比教师解答步骤更多,表明其步骤效率低下且错误累积风险较高。
AI 推荐理由
论文核心是评估 LLM 推理能力的基准,深入分析多步推理中的状态维持与错误积累问题。
研究机构
西北大学
圣塔克拉拉大学
杜克大学
伯明翰大学
罗切斯特大学
Analog AI, Inc.
论文信息