摘要
检索正从单次匹配转向交互式推理,语言代理需迭代检查证据并重构查询。训练此类代理面临信用分配挑战:可执行动作可直接评估,而潜在推理步骤不可观察且仅影响未来动作,导致结果级奖励分配不可靠。本文提出 RICE-PO,一种无需评论家的策略优化框架,将检索交互转化为局部学习信号。该方法选取高不确定性动作作为锚点,利用检索指标评估局部反事实分支,仅在推理对动作影响显著且未来残差稳定时将信用传播至潜在推理步骤。实验表明其在 BRIGHT 和 BEIR 数据集上优于现有基线。
AI 推荐理由
论文核心解决交互式检索中潜在推理步骤的信用分配难题,直接提升代理推理能力。
研究机构
University of Massachusetts, Amherst
Texas Tech University
University of Connecticut
论文信息