摘要
当前大语言模型在执行复杂多阶段任务时面临挑战。组相对策略优化(GRPO)依赖稀疏结果奖励,限制了中间步骤的信用分配。现有方法成本高或受限。本文假设利用 LLM 隐藏状态的内部正确性探测可作为步骤级奖励信号。针对前缀污染导致探测失效的问题,提出前缀感知内部奖励(PAIR)模型。该两阶段模型结合冻结的隐藏状态探针估计信念一致性,并利用轻量级注意力头修正为基于事实的正确性。实验表明,PAIR 在污染轨迹上取得最高 AUROC,且推理成本极低,无需外部模型或真实答案即可为 GRPO 提供密集奖励信号。
AI 推荐理由
提出内部奖励模型优化多步 Agent,通过自我信号实现策略进化与改进。
研究机构
KAIST
Yonsei University
论文信息