摘要
针对现有基准仅评估正确性而忽视最优性的问题,本文提出 OPT-BENCH,首个通过质量感知 RLVR 训练和评估大语言模型解决 NP-hard 优化问题的框架。该框架包含可扩展的训练基础设施、严谨的基准测试及质量感知奖励机制。实验表明,该方法在成功率和质量比上显著优于 GPT-4o,并能泛化至数学、逻辑等多样任务,证实了质量感知奖励对复杂推理能力提升的关键作用。
AI 推荐理由
论文核心研究基于 RLVR 提升 LLM 在 NP-hard 优化问题中的推理质量与最优解能力。
研究机构
同济大学
上海人工智能实验室
浙江大学
中国科学院大学
论文信息