Process Reward Model Data Analysis Agent Reasoning Enhancement
摘要

本文针对通用过程奖励模型(PRM)在动态数据分析任务中难以检测静默错误及误罚探索行为的问题,提出了 DataPRM。这是一种环境感知的生成式过程奖励模型,能主动交互验证中间状态并采用反思感知的三元奖励策略。实验表明,DataPRM 显著提升了下游策略模型在多个基准上的表现,且在强化学习中优于结果奖励基线,验证了过程监督的有效性。

AI 推荐理由

论文核心提出过程奖励模型以增强 Agent 在动态数据分析中的推理纠错能力。

研究机构
Zhejiang University Ant Group Hangzhou, China Huajun Chen
论文信息
作者 Zhisong Qiu, Shuofei Qiao, Kewei Xu, Yuqi Zhu, Lun Du et al.
发布日期 2026-04-27
arXiv ID 2604.24198
相关性评分 9/10 (高度相关)