摘要
大语言模型在推理基准上表现优异,但其解决需端到端工作流的现实问题能力尚不明确。本文提出一种面向问题、分阶段的评估框架,利用专家验证标准评估 LLM 在建模各阶段的表现。通过对比自动评分与人类专家判断,验证了框架的可靠性。研究发现,先进 LLM 存在“理解 - 执行”差距:虽擅长问题识别与表述,但在模型求解、代码实现及结果分析等执行阶段存在持续缺陷,且错误会跨阶段传播。研究表明,仅靠扩大模型规模无法弥合此差距。
AI 推荐理由
论文核心评估 LLM 在数学建模中的端到端推理能力,深入分析推理链条中的理解与执行差距。
研究机构
Beijing Institute of Technology, Beijing, China
Southeast Academy of Information Technology, Putian, China
论文信息