Reinforcement Learning Open-ended Reasoning Rubric Generation Agentic Search
摘要

针对开放域推理与长文本生成任务缺乏可靠自动验证信号的问题,本文提出“深度研究即评分标准”(DR-rubric)框架。该方法将评分标准构建视为研究过程:第一阶段通过多轮代理搜索获取领域事实与失败模式;第二阶段将证据提炼为原子化约束,用于基于 GRPO 的策略优化。实验表明,该框架仅需少量训练数据即可在多项基准测试中取得优异性能,证明了将静态评估模板转化为证据驱动的研究过程能提供更可扩展、细粒度的奖励信号。

AI 推荐理由

论文核心解决开放域推理任务的奖励信号问题,通过深度研究构建评分标准以优化推理策略。

研究机构
Fudan University
论文信息
作者 Wangyi Mei, Zhouhong Gu, Zhenhan Bai, Yin Cai, Lefan Zhang et al.
发布日期 2026-05-31
arXiv ID 2606.01091
相关性评分 9/10 (高度相关)