Reinforcement Learning Personalization Agent Evolution Memory Architecture
摘要

针对现实应用中用户行为偏好的异质性挑战,本文提出一种个性化代理强化学习框架。核心方法包括个性化锚点奖励解耦策略优化(PARPO),将通用任务质量奖励与个性化偏好奖励解耦;以及偏好对齐技能进化图记忆(PSGM),支持个性化监督与技能检索。该框架构建了偏好识别、策略优化与结构化技能积累的闭环,在多个基准测试中显著优于现有记忆与强化学习基线。

AI 推荐理由

论文提出技能进化图记忆与自我优化框架,核心在于代理的自适应进化与个性化策略改进。

研究机构
University of Science and Technology of China Alibaba Group
论文信息
作者 Ranxu zhang, zeyang li, Jiacheng Huang, Rui Zhang, Xiaozhou Xu et al.
发布日期 2026-05-22
arXiv ID 2605.23382
相关性评分 9/10 (高度相关)