Self-Evolution Memory Mechanism Training-Free Human-AI Collaboration
摘要

针对复杂长程任务中用户需求动态不确定的挑战,现有强化学习方法存在训练成本高及信用分配困难的问题。本文提出 PRIME 框架,这是一种无需梯度的学习范式,通过显式经验积累而非参数优化实现代理持续进化。该框架将多轮交互轨迹提炼为包含成功策略、失败模式及用户偏好的结构化经验,并通过元操作使其进化,利用检索增强生成指导未来行为。实验表明,PRIME 在保持成本效益与可解释性的同时,性能媲美基于梯度的方法。

AI 推荐理由

论文提出基于迭代记忆进化的无训练框架,核心在于代理的自我进化与经验积累机制。

研究机构
卡内基梅隆大学
论文信息
作者 Prince Zizhuang Wang, Shuli Jiang
发布日期 2026-04-08
arXiv ID 2604.07645
相关性评分 9/10 (高度相关)