摘要
检索增强型智能体虽能查询外部证据,但在多步推理中的可靠性仍受限:噪声检索可能破坏多跳问答,而仅基于结果的强化学习提供的信用信号过于粗糙,难以优化中间步骤。本文提出 EvalAct(评估即行动),将隐式的检索质量评估转化为显式动作,强制执行“搜索至评估”协议,使每次检索后紧跟结构化评分,生成与交互轨迹对齐的过程信号。为此,我们引入基于 GRPO 的过程校准优势重缩放(PCAR)方法,根据评估分数在片段级别重缩放优势值,强调可靠片段并保守更新不确定部分。七个开放域问答基准实验表明,EvalAct 取得了最佳平均准确率,尤其在多跳任务上提升显著。
AI 推荐理由
论文核心解决多步推理中检索噪声问题,通过显式评估优化推理过程信号。
研究机构
北京交通大学计算机与技术学院
Hithink Research
论文信息