Multi-Answer QA Reinforcement Learning Tool Use Credit Assignment
摘要

大型语言模型常作为工具增强代理以获取参数外知识,但现有工作多聚焦单答案任务。针对需发现全面有效答案集的多答案问答场景,本文提出 SPADER 强化学习框架。该框架包含逐步同伴优势机制,实现无评论家的步级信用分配;以及多样性感知探索奖励,促进长尾实体发现。实验表明,SPADER 在多项基准上显著提升了召回率与 F1 值,优于基于提示及结果监督的方法。

AI 推荐理由

论文核心解决长程工具使用中的细粒度信用分配与推理对齐问题,属推理机制研究。

研究机构
State Key Lab of CAD&CG, Zhejiang University School of Software and Microelectronics, Peking University School of Software Technology, Zhejiang University
论文信息
作者 Qiming Shi, Zhaolu Kang, Yunfan Zhou, Di Weng, Yingcai Wu
发布日期 2026-05-30
arXiv ID 2606.00593
相关性评分 9/10 (高度相关)