Reinforcement Learning Optimization Reasoning RLVR
摘要

针对现有基准仅评估正确性而忽视最优性的问题,本文提出 OPT-BENCH,首个通过质量感知 RLVR 训练和评估大语言模型解决 NP-hard 优化问题的框架。该框架包含可扩展的训练基础设施、严谨的基准测试及质量感知奖励机制。实验表明,该方法在成功率和质量比上显著优于 GPT-4o,并能泛化至数学、逻辑等多样任务,证实了质量感知奖励对复杂推理能力提升的关键作用。

AI 推荐理由

论文核心研究基于 RLVR 提升 LLM 在 NP-hard 优化问题中的推理质量与最优解能力。

研究机构
同济大学 上海人工智能实验室 浙江大学 中国科学院大学
论文信息
作者 Xiaozhe Li, Xinyu Fang, Shengyuan Ding, Yang Li, Linyang Li et al.
发布日期 2026-05-09
arXiv ID 2605.08905
相关性评分 9/10 (高度相关)