摘要
长程大语言模型智能体依赖中间信息收集步骤,但训练反馈通常仅在最终答案处获得,因过程级奖励需高质量人工标注。现有步级塑造方法需答案监督或特定任务验证器,而无标签强化学习方法仅能在答案或轨迹层面提取信号。本文提出自诱导结果势(SIOP),将最终答案的语义簇视为潜在未来状态,进行基于势能的步级信用分配。该方法通过采样多次 rollout、聚类答案并构建可靠性感知分布,奖励增加可靠未来状态后验支持的步骤。在七个搜索增强推理基准上,SIOP 优于无验证器基线并接近有监督基线。
AI 推荐理由
论文提出无验证器下的步级信用分配方法,显著提升长程推理任务表现。
研究机构
香港科技大学STEM实验室
牛津大学
城市大学
萨塞克斯大学
清华大学
华中科技大学
论文信息