摘要
强化学习有望增强大语言模型在外部环境中的智能体推理能力,但终端奖励的稀疏性阻碍了细粒度的状态级优化。尽管过程奖励建模提供了替代方案,但其训练成本高昂且难以扩展。为此,本文提出 RewardFlow,一种专为智能体推理任务设计的轻量级状态级奖励估计方法。该方法利用推理轨迹中状态的内在拓扑结构构建状态图,分析状态对成功的贡献,并通过拓扑感知的图传播量化贡献以生成客观的状态级奖励。在四个智能体推理基准测试中,RewardFlow 作为密集奖励集成到 RL 优化中,显著优于现有基线,展现出卓越的性能、鲁棒性和训练效率。
AI 推荐理由
论文核心解决 Agent 推理任务中的奖励稀疏问题,通过状态图传播优化推理能力。
研究机构
TMLR Group, 香港浸会大学
TCL Corporate Research (HK) Co., Ltd.
合作媒体创新中心, 上海交通大学
香港浸会大学数学系
论文信息