RLVR 推理增强 知识密集型任务 数据合成
摘要

可验证奖励的强化学习(RLVR)在提升大语言模型数学与编码推理能力方面潜力巨大,但因缺乏高质量可验证数据,其在知识密集型领域的应用尚未得到有效探索。此外,现有 RLVR 仅关注最终答案正确性,导致推理缺陷和奖励信号稀疏。本文提出“从知识到验证”(K2V)框架,通过自动化合成可验证数据将 RLVR 扩展至知识密集型领域,并实现对 LLM 推理过程的验证。实验表明,K2V 显著增强了模型在该领域的推理能力,且未明显损害其通用能力。

AI 推荐理由

论文核心在于通过 RLVR 框架增强 LLM 在知识密集型领域的推理过程验证与能力。

研究机构
上海人工智能实验室 上海创新研究院
论文信息
作者 Zhonghang Yuan, Zhefan Wang, Fang Hu, Zihong Chen, Jinzhe Li et al.
发布日期 2026-05-18
arXiv ID 2605.18261
相关性评分 9/10 (高度相关)