摘要
可验证奖励强化学习(RLVR)能显著提升大语言模型在可验证任务上的推理能力,但其在通用问答(GQA)中的迁移效果尚未经过充分验证。本文提出跨代评估框架,发现 RLVR 生成的思维过程在 GQA 任务中效率显著较低,且直接对 GQA 进行 RL 训练效果不佳,原因在于 GQA 存在无需高质量思维的奖励捷径。为此,作者提出“分离思维与响应训练”(START)方法,先仅利用最终答案奖励训练思维过程。实验表明,该方法在多个基准上有效提升了思维质量及最终答案准确率。
AI 推荐理由
论文核心研究 RLVR 对 LLM 推理思维过程的影响及改进方法,直接针对推理能力。
研究机构
国家新一代人工智能开放创新平台(南京大学)
南京大学计算机学院
华为技术有限公司
论文信息