摘要
近期大型语言模型搜索代理利用可验证奖励的强化学习(RLVR)从结果奖励中学习搜索增强推理。然而在处理难题时,代理极少采样到端到端成功的轨迹,导致仅基于结果的 RLVR 缺乏正奖励样本。本文提出一种训练时机制“信用衰减特权反馈”(CAPF),利用验证器端的错误识别信息指导代理在展开过程中修正零奖励尝试,生成正奖励修复轨迹,并通过信用衰减机制适应无反馈的部署环境。实验表明,CAPF 将 Qwen3-4B 在七个开放域问答基准上的平均精确匹配得分从 44.7% 提升至 48.5%。
AI 推荐理由
论文核心在于利用特权反馈引导搜索代理修正推理错误,显著提升复杂问题的推理准确率。
研究机构
Xinye Liao
Xin Liao
Chonghan Liu
论文信息