Reinforcement Learning Self-Reflection Agent Training Autonomous Reasoning
摘要

将大语言模型训练为自主智能体通常始于模仿学习,但这仅教会智能体“做什么”而非“为什么”,缺乏对行动质量的认知。现有方法虽引入基于对比的自我反思监督,但本质上仍是模仿预构建的反思文本。本文提出代理批判性训练(ACT),一种强化学习范式,通过奖励模型对备选行动中更优者的正确判断,驱动其自主发展关于行动质量的推理能力,从而产生真正的自我反思而非模仿。在三个基准测试中,ACT 显著提升了智能体性能,并展现出优异的分布外泛化能力及通用推理提升。

AI 推荐理由

提出强化学习范式训练智能体自主反思与判断行动质量,核心聚焦自我进化能力。

研究机构
马里兰大学帕克分校
论文信息
作者 Weize Liu, Minghui Liu, Sy-Tuyen Ho, Souradip Chakraborty, Xiyao Wang et al.
发布日期 2026-03-09
arXiv ID 2603.08706
相关性评分 9/10 (高度相关)