User Simulation Self-Evolution Reinforcement Learning Chinese NLP
摘要

用户模拟器对交互式 AI 系统的训练与评估至关重要。现有方法常依赖浅层画像,难以维持长对话中的人格一致性,且多局限于英文或单领域。本文提出 MUSE,一种多领域中文用户模拟框架。首先,引入迭代画像自进化(IPSE)机制,通过对比模拟轨迹与真实行为差异逐步优化用户画像。其次,应用角色反转监督微调提升局部响应真实感。最后,训练基于准则的奖励模型并结合多轮强化学习,实现细粒度行为对齐及长程一致性优化。实验表明,MUSE 在语句与会话级评估中均优于基线。

AI 推荐理由

论文核心提出自进化用户画像机制,通过迭代优化实现代理自我改进与行为对齐。

研究机构
福州大学计算机与人工智能学院 Meituan
论文信息
作者 Zihao Liu, Hantao Zhou, Jiguo Li, Jun Xu, Jiuchong Gao et al.
发布日期 2026-04-15
arXiv ID 2604.13828
相关性评分 9/10 (高度相关)