optimization benchmark LLM reasoning agent
摘要

尽管大语言模型展现出卓越的推理能力,但在复杂优化任务中仍面临挑战,需依赖领域知识与稳健实现。现有基准多局限于数学规划与组合优化,评估范围狭窄。为此,本文推出 OptiVerse,涵盖随机优化、动态优化、博弈优化及最优控制等被忽视领域的 1000 个精选问题,分三个难度等级。实验显示,即便先进模型在难题上准确率亦不足 27%,主要瓶颈在于建模与逻辑错误。据此,作者提出双视角审计代理,显著提升建模准确性且无明显时间开销。

AI 推荐理由

论文聚焦优化问题求解中的建模与逻辑推理瓶颈,提出审计代理提升推理准确率。

研究机构
School of Computer Science and Technology, Xi'an Jiaotong University Ministry of Education Key Laboratory of Intelligent Networks and Network Security, China Shaanxi Province Key Laboratory of Big Data Knowledge Engineering, China Lenovo Research
论文信息
作者 Xinyu Zhang, Boxuan Zhang, Yuchen Wan, Lingling Zhang, YiXing Yao et al.
发布日期 2026-04-23
arXiv ID 2604.21510
相关性评分 9/10 (高度相关)