摘要
大型语言模型通常通过采样或搜索在推理时单独解决组合优化问题。本文探讨利用强化学习将部分推理成本转移至代码大模型权重中,使其为整个问题族合成可复用的求解器。在协同依赖选择任务上,经 GRPO 微调的模型收敛至约束感知的模拟退火模板,显著缩小了与最优求解器的差距,并大幅降低了执行成本。实验表明该策略能有效克服基础模型在复杂逻辑推理中的局部启发式缺陷,实现高效的问题求解。
AI 推荐理由
论文核心研究利用 RL 将组合优化推理成本内化至模型权重,合成可复用求解器。
研究机构
ETH Zürich
Zurich, Switzerland
University of Maryland
College Park, MD, USA
论文信息