摘要
将大语言模型训练为自主智能体通常始于模仿学习,但这仅教会智能体“做什么”而非“为什么”,缺乏对行动质量的认知。现有方法虽引入基于对比的自我反思监督,但本质上仍是模仿预构建的反思文本。本文提出代理批判性训练(ACT),一种强化学习范式,通过奖励模型对备选行动中更优者的正确判断,驱动其自主发展关于行动质量的推理能力,从而产生真正的自我反思而非模仿。在三个基准测试中,ACT 显著提升了智能体性能,并展现出优异的分布外泛化能力及通用推理提升。
AI 推荐理由
提出强化学习范式训练智能体自主反思与判断行动质量,核心聚焦自我进化能力。
研究机构
马里兰大学帕克分校
论文信息