摘要
强化学习虽能增强大语言模型推理能力,但在多轮智能体任务中因交互长程性和环境反馈随机性而面临挑战。本文指出智能体探索中存在结构性失效模式:次优动作引发噪声观察,导致误导性上下文并削弱后续决策,形成难以恢复的错误累积循环。为此,我们提出 ProCeedRL,将被动选择转变为主动干预。该方法利用过程级批评器实时监控交互,结合基于反思的演示引导智能体停止错误累积。实验表明,该方法显著超越饱和探索性能,在复杂深度搜索和具身任务中实现了更高效的探索与卓越表现。
AI 推荐理由
论文核心针对 LLM 智能体推理中的错误累积问题,提出新 RL 框架显著提升推理能力。
研究机构
上海交通大学
论文信息