摘要
可验证奖励的强化学习(RLVR)在提升大语言模型数学与编码推理能力方面潜力巨大,但因缺乏高质量可验证数据,其在知识密集型领域的应用尚未得到有效探索。此外,现有 RLVR 仅关注最终答案正确性,导致推理缺陷和奖励信号稀疏。本文提出“从知识到验证”(K2V)框架,通过自动化合成可验证数据将 RLVR 扩展至知识密集型领域,并实现对 LLM 推理过程的验证。实验表明,K2V 显著增强了模型在该领域的推理能力,且未明显损害其通用能力。
AI 推荐理由
论文核心在于通过 RLVR 框架增强 LLM 在知识密集型领域的推理过程验证与能力。
研究机构
上海人工智能实验室
上海创新研究院
论文信息