Reinforcement Learning Reasoning Enhancement Critique Training Data Utilization
摘要

强化学习虽赋予了大语言模型强大的推理能力,但传统方法仅关注一阶展开(生成多个回答),忽视了批判能力的训练,导致数据潜力未充分挖掘。本文提出二阶展开概念(为回答生成多个批判),并构建统一框架联合训练生成与批判能力。实验表明,该方法在同等数据下优于传统 RL,有效提升了推理性能。此外,研究还揭示了批判训练中标签平衡的重要性及基于结果奖励的噪声问题,为动态数据增强和联合训练提供了新见解。

AI 推荐理由

论文核心在于通过二阶展开和联合训练提升 LLM 的推理能力,直接针对推理机制优化。

研究机构
国家多媒体信息处理重点实验室,北京大学计算机学院
论文信息
作者 Zhe Yang, Yudong Wang, Rang Li, Zhifang Sui
发布日期 2026-02-26
arXiv ID 2602.22765
相关性评分 9/10 (高度相关)