RLVR Math Reasoning Exploration Strategy
摘要

可验证奖励强化学习(RLVR)是提升大语言模型推理能力的可扩展范式,但受限于探索效率。本文提出 NudgeRL 框架,通过“策略 nudging

AI 推荐理由

论文核心旨在通过结构化探索提升 LLM 在数学基准上的推理能力,直接针对推理机制优化。

研究机构
KAIST DeepAuto.ai
论文信息
作者 Chanuk Lee, Sangwoo Park, Minki Kang, Sung Ju Hwang
发布日期 2026-05-15
arXiv ID 2605.15726
相关性评分 9/10 (高度相关)