Reinforcement Learning Agentic Reasoning Reward Modeling State Graphs
摘要

强化学习有望增强大语言模型在外部环境中的智能体推理能力,但终端奖励的稀疏性阻碍了细粒度的状态级优化。尽管过程奖励建模提供了替代方案,但其训练成本高昂且难以扩展。为此,本文提出 RewardFlow,一种专为智能体推理任务设计的轻量级状态级奖励估计方法。该方法利用推理轨迹中状态的内在拓扑结构构建状态图,分析状态对成功的贡献,并通过拓扑感知的图传播量化贡献以生成客观的状态级奖励。在四个智能体推理基准测试中,RewardFlow 作为密集奖励集成到 RL 优化中,显著优于现有基线,展现出卓越的性能、鲁棒性和训练效率。

AI 推荐理由

论文核心解决 Agent 推理任务中的奖励稀疏问题,通过状态图传播优化推理能力。

研究机构
TMLR Group, 香港浸会大学 TCL Corporate Research (HK) Co., Ltd. 合作媒体创新中心, 上海交通大学 香港浸会大学数学系
论文信息
作者 Xiao Feng, Bo Han, Zhanke Zhou, Jiaqi Fan, Jiangchao Yao et al.
发布日期 2026-03-19
arXiv ID 2603.18859
相关性评分 9/10 (高度相关)