摘要
大型语言模型在复杂长程智能体决策任务中表现受限。现有方法多依赖多轮强化学习设计奖励模型,但面临稀疏结果奖励传播延迟及细粒度回合级奖励信用分配不可靠的问题。本文提出 HISR 方法,利用后见信息调制分段过程奖励,使奖励与子目标紧密对齐并突出关键片段。具体而言,引入分段级过程奖励模型为每个子目标分配奖励,避免过度细粒度划分;设计后见模型反映已知轨迹结果后的动作偏好,通过序列似然比衡量动作重要性以聚合分段得分,进而调制奖励,显著提升信用分配可靠性。
AI 推荐理由
论文针对多轮智能体长程决策,通过子目标分段奖励优化信用分配,核心解决规划问题。
研究机构
中国科学院航空信息研究所
中国科学院大学
论文信息