Reinforcement Learning Skill Evolution Mathematical Reasoning Hierarchical Agent
摘要

针对现有数学推理方法孤立处理问题、忽视可复用策略积累的局限,本文提出 ARISE 框架。该框架采用分层强化学习架构,包含高层技能管理器与低层执行者。管理器通过结构化总结成功轨迹构建分层技能库,并利用策略驱动机制检索相关技能以指导后续推理。分层奖励设计引导推理能力与技能库质量的协同进化。实验表明,ARISE 在多个基准测试中优于 GRPO 系列及记忆增强基线,尤其在分布外任务上表现显著,且组件消融研究证实了各部分的有效性。

AI 推荐理由

论文核心提出技能进化框架,通过分层 RL 实现策略与技能库的协同进化。

研究机构
乔治华盛顿大学电气与计算机工程系 德克萨斯大学达拉斯分校数学科学系 乔治华盛顿大学商学院
论文信息
作者 Yu Li, Rui Miao, Zhengling Qi, Tian Lan
发布日期 2026-03-17
arXiv ID 2603.16060
相关性评分 9/10 (高度相关)