摘要
基于规则的强化学习虽提升了大语言模型的通用推理能力,但常受限于当前策略分布导致探索无效。本文提出 HeRL 框架,利用事后经验引导有效探索,明确告知模型奖励所期望的行为。该方法将失败轨迹及其未满足规则视为事后经验,作为上下文指导策略探索超出当前分布的理想响应,并引入额外奖励以激励更具改进潜力的回答。实验表明,HeRL 在多个基准测试中优于基线,且能在测试时通过经验引导实现自我提升。
AI 推荐理由
论文核心旨在通过强化学习提升 LLM 的通用推理能力,提出新框架解决探索效率问题。
研究机构
大连理工大学
浙江大学
中国科学院科学与技术学院
论文信息