Reinforcement Learning LLM Reasoning Effective Exploration Hindsight Experience
摘要

基于规则的强化学习虽提升了大语言模型的通用推理能力,但常受限于当前策略分布导致探索无效。本文提出 HeRL 框架,利用事后经验引导有效探索,明确告知模型奖励所期望的行为。该方法将失败轨迹及其未满足规则视为事后经验,作为上下文指导策略探索超出当前分布的理想响应,并引入额外奖励以激励更具改进潜力的回答。实验表明,HeRL 在多个基准测试中优于基线,且能在测试时通过经验引导实现自我提升。

AI 推荐理由

论文核心旨在通过强化学习提升 LLM 的通用推理能力,提出新框架解决探索效率问题。

研究机构
大连理工大学 浙江大学 中国科学院科学与技术学院
论文信息
作者 Wenjian Zhang, Kongcheng Zhang, Jiaxin Qi, Baisheng Lai, Jianqiang Huang
发布日期 2026-03-20
arXiv ID 2603.20046
相关性评分 9/10 (高度相关)