RLVR Reasoning General QA START Evaluation Framework
摘要

可验证奖励强化学习(RLVR)能显著提升大语言模型在可验证任务上的推理能力,但其在通用问答(GQA)中的迁移效果尚未经过充分验证。本文提出跨代评估框架,发现 RLVR 生成的思维过程在 GQA 任务中效率显著较低,且直接对 GQA 进行 RL 训练效果不佳,原因在于 GQA 存在无需高质量思维的奖励捷径。为此,作者提出“分离思维与响应训练”(START)方法,先仅利用最终答案奖励训练思维过程。实验表明,该方法在多个基准上有效提升了思维质量及最终答案准确率。

AI 推荐理由

论文核心研究 RLVR 对 LLM 推理思维过程的影响及改进方法,直接针对推理能力。

研究机构
国家新一代人工智能开放创新平台(南京大学) 南京大学计算机学院 华为技术有限公司
论文信息
作者 Kaiyuan Li, Jing-Cheng Pang, Yang Yu
发布日期 2026-03-21
arXiv ID 2603.20799
相关性评分 9/10 (高度相关)