Self-Evolution Co-Evolution LLM Agents Dynamic Training
摘要

尽管大语言模型(LLM)Agent 在复杂任务中表现优异,但其学习常受限于低效的交互反馈和静态训练环境,阻碍了泛化能力。为此,本文提出 Role-Agent 框架,利用单个 LLM 同时充当 Agent 和环境,实现自举式协同进化。该框架包含两个协同组件:World-In-Agent(WIA)中,LLM 预测动作后的未来状态,利用预测与实际状态的对齐作为过程奖励,增强环境感知推理;Agent-In-World(AIW)中,LLM 分析失败轨迹的模式并检索相似任务,重塑训练数据分布以进行针对性练习。多基准实验表明,Role-Agent 性能一致提升,平均优于强基线超过 4%。

AI 推荐理由

论文提出双角色协同进化框架,核心机制在于 Agent 与环境的自举共进化及自我改进。

研究机构
University of Science and Technology of China AMAP, Alibaba Group
论文信息
作者 Xucong Wang, Ziyu Ma, Shidong Yang, Tongwen Huang, Pengkun Wang et al.
发布日期 2026-06-09
arXiv ID 2606.10917
相关性评分 9/10 (高度相关)