摘要
大型语言模型虽能生成语法有效的优化程序,但常难以可靠选择有效的建模策略,导致公式错误及求解低效。本文提出 SAGE 框架,在数据构建与后训练中显式化建模策略。该框架构建了求解器验证的多策略数据集,并通过监督微调结合分段加权 GRPO 算法训练学生模型,综合奖励格式合规性、正确性及求解效率。实验表明,SAGE 在多个基准测试中显著提升了通过率与解的多样性,并生成了更紧凑的约束系统,证明了显式策略对自动化优化建模的改进作用。
AI 推荐理由
论文核心在于提升 LLM 在优化建模中的策略选择与逻辑推理能力,通过显式建模策略解决推理错误。
研究机构
School of Computer Science and Engineering, Beihang University, Beijing, China
论文信息