credit assignment reinforcement learning agentic reasoning verifier-free
摘要

长程大语言模型智能体依赖中间信息收集步骤,但训练反馈通常仅在最终答案处获得,因过程级奖励需高质量人工标注。现有步级塑造方法需答案监督或特定任务验证器,而无标签强化学习方法仅能在答案或轨迹层面提取信号。本文提出自诱导结果势(SIOP),将最终答案的语义簇视为潜在未来状态,进行基于势能的步级信用分配。该方法通过采样多次 rollout、聚类答案并构建可靠性感知分布,奖励增加可靠未来状态后验支持的步骤。在七个搜索增强推理基准上,SIOP 优于无验证器基线并接近有监督基线。

AI 推荐理由

论文提出无验证器下的步级信用分配方法,显著提升长程推理任务表现。

研究机构
香港科技大学STEM实验室 牛津大学 城市大学 萨塞克斯大学 清华大学 华中科技大学
论文信息
作者 Senkang Hu, Yong Dai, Xudong Han, Zhengru Fang, Yuzhi Zhao et al.
发布日期 2026-05-06
arXiv ID 2605.04984
相关性评分 9/10 (高度相关)