摘要
尽管大语言模型(LLM)Agent 在复杂任务中表现优异,但其学习常受限于低效的交互反馈和静态训练环境,阻碍了泛化能力。为此,本文提出 Role-Agent 框架,利用单个 LLM 同时充当 Agent 和环境,实现自举式协同进化。该框架包含两个协同组件:World-In-Agent(WIA)中,LLM 预测动作后的未来状态,利用预测与实际状态的对齐作为过程奖励,增强环境感知推理;Agent-In-World(AIW)中,LLM 分析失败轨迹的模式并检索相似任务,重塑训练数据分布以进行针对性练习。多基准实验表明,Role-Agent 性能一致提升,平均优于强基线超过 4%。
AI 推荐理由
论文提出双角色协同进化框架,核心机制在于 Agent 与环境的自举共进化及自我改进。
研究机构
University of Science and Technology of China
AMAP, Alibaba Group
论文信息