Reinforcement Learning Code Generation Optimization Agent Skills Execution Verification
摘要

利用大语言模型自动化优化建模是决策智能的关键路径,但现有方法依赖高延迟的闭源模型或易过拟合的单求解器微调。本文提出执行验证优化建模(EVOM)框架,将数学规划求解器作为确定性交互验证器。该框架生成特定求解器代码并在沙箱中执行,将结果转化为标量奖励,通过闭环过程优化模型。该方法无需过程级监督,支持跨求解器泛化及零样本迁移,在多个基准测试中表现优异,实现了低成本的求解器自适应。

AI 推荐理由

论文核心研究 Agent 调用求解器 API 生成代码的技能,通过执行验证强化学习优化该技能。

研究机构
School of Computer Science and Engineering, Nanjing University of Science and Technology, School of Intelligence Science and Technology, Nanjing University Institute of Automation, Chinese Academy of Sciences Correspondence to: Rui Xia
论文信息
作者 Runda Guan, Xiangqing Shen, Jiajun Zhang, Yifan Zhang, Jian Cheng et al.
发布日期 2026-04-01
arXiv ID 2604.00442
相关性评分 9/10 (高度相关)