摘要
在电商领域,LLM 智能体虽具潜力,但面临缺乏长期偏好评估基准及偏好识别与辅助任务割裂的挑战。本文提出涵盖百万级商品的长期记忆基准,并推出“购物伴侣”框架。该框架统一处理记忆检索与购物辅助,支持用户干预。通过引入工具级奖励的双重强化学习策略,有效解决了多轮交互中奖励稀疏问题。实验表明,该方法在轻量模型上显著优于现有基线,验证了统一设计的有效性。
AI 推荐理由
论文核心提出记忆增强架构,解决长对话偏好捕捉难题,属记忆机制核心研究。
研究机构
阿里巴巴国际数字商业集团
论文信息