LLM 评估 数学建模 推理能力 端到端工作流
摘要

大语言模型在推理基准上表现优异,但其解决需端到端工作流的现实问题能力尚不明确。本文提出一种面向问题、分阶段的评估框架,利用专家验证标准评估 LLM 在建模各阶段的表现。通过对比自动评分与人类专家判断,验证了框架的可靠性。研究发现,先进 LLM 存在“理解 - 执行”差距:虽擅长问题识别与表述,但在模型求解、代码实现及结果分析等执行阶段存在持续缺陷,且错误会跨阶段传播。研究表明,仅靠扩大模型规模无法弥合此差距。

AI 推荐理由

论文核心评估 LLM 在数学建模中的端到端推理能力,深入分析推理链条中的理解与执行差距。

研究机构
Beijing Institute of Technology, Beijing, China Southeast Academy of Information Technology, Putian, China
论文信息
作者 Yuhang Liu, Heyan Huang, Yizhe Yang, Hongyan Zhao, Zhizhuo Zeng et al.
发布日期 2026-04-06
arXiv ID 2604.04791
相关性评分 9/10 (高度相关)