摘要
本文针对通用过程奖励模型(PRM)在动态数据分析任务中难以检测静默错误及误罚探索行为的问题,提出了 DataPRM。这是一种环境感知的生成式过程奖励模型,能主动交互验证中间状态并采用反思感知的三元奖励策略。实验表明,DataPRM 显著提升了下游策略模型在多个基准上的表现,且在强化学习中优于结果奖励基线,验证了过程监督的有效性。
AI 推荐理由
论文核心提出过程奖励模型以增强 Agent 在动态数据分析中的推理纠错能力。
研究机构
Zhejiang University
Ant Group
Hangzhou, China
Huajun Chen
论文信息