optimization modeling strategy-aware GRPO mathematical reasoning
摘要

大型语言模型虽能生成语法有效的优化程序,但常难以可靠选择有效的建模策略,导致公式错误及求解低效。本文提出 SAGE 框架,在数据构建与后训练中显式化建模策略。该框架构建了求解器验证的多策略数据集,并通过监督微调结合分段加权 GRPO 算法训练学生模型,综合奖励格式合规性、正确性及求解效率。实验表明,SAGE 在多个基准测试中显著提升了通过率与解的多样性,并生成了更紧凑的约束系统,证明了显式策略对自动化优化建模的改进作用。

AI 推荐理由

论文核心在于提升 LLM 在优化建模中的策略选择与逻辑推理能力,通过显式建模策略解决推理错误。

研究机构
School of Computer Science and Engineering, Beihang University, Beijing, China
论文信息
作者 Ruiqing Zhao, Fengzhi Li, Yuan Zuo, Rui Liu, Yansong Liu et al.
发布日期 2026-05-04
arXiv ID 2605.02545
相关性评分 9/10 (高度相关)