摘要
针对搜索密集型多步推理任务中 ReAct 代理依赖内部判断导致轨迹浅显冗余的问题,本文提出 Co-ReAct 框架。该框架在推理阶段将评分标准(rubrics)作为逐步指导注入上下文,明确证据搜集与推理目标。为确保指导可靠性,作者利用 GRPO 训练专用评分标准生成器,优化列表级排序相关性奖励以契合专家共识。实验表明,Co-ReAct 在多个基准测试及不同规模模型上均显著优于现有 ReAct 及测试时计算基线,且生成器可作为即插即用组件提升各类代理性能。
AI 推荐理由
论文核心在于通过评分标准引导 ReAct 代理的逐步推理决策,显著提升多步推理任务表现。
研究机构
Owen Applications Business Group of Alibaba
论文信息