摘要
可验证奖励强化学习(RLVR)是提升大语言模型推理能力的可扩展范式,但受限于探索效率。本文提出 NudgeRL 框架,通过“策略 nudging
AI 推荐理由
论文核心旨在通过结构化探索提升 LLM 在数学基准上的推理能力,直接针对推理机制优化。
研究机构
KAIST
DeepAuto.ai
论文信息