ReAct Step-level Guidance Multi-step Reasoning Rubric Generation GRPO
摘要

针对搜索密集型多步推理任务中 ReAct 代理依赖内部判断导致轨迹浅显冗余的问题,本文提出 Co-ReAct 框架。该框架在推理阶段将评分标准(rubrics)作为逐步指导注入上下文,明确证据搜集与推理目标。为确保指导可靠性,作者利用 GRPO 训练专用评分标准生成器,优化列表级排序相关性奖励以契合专家共识。实验表明,Co-ReAct 在多个基准测试及不同规模模型上均显著优于现有 ReAct 及测试时计算基线,且生成器可作为即插即用组件提升各类代理性能。

AI 推荐理由

论文核心在于通过评分标准引导 ReAct 代理的逐步推理决策,显著提升多步推理任务表现。

研究机构
Owen Applications Business Group of Alibaba
论文信息
作者 Jiazheng Kang, Bowen Zhang, Zixin Song, Jiangwang Chen, Xiao Yang et al.
发布日期 2026-05-22
arXiv ID 2605.23590
相关性评分 9/10 (高度相关)