摘要
理解客户购物轨迹对个性化体验至关重要,但跨多年的超长记录给现有大模型带来巨大挑战。针对现有基准仅限短轨迹且真实数据稀缺的问题,本文构建了 ShopTrajQA 基准,包含长达 64k token 的模拟轨迹。研究揭示了前沿模型在长轨迹推理上的不足,并提出 Customer Agent 框架。该框架利用可验证奖励的强化学习(RLVR),将轨迹存储为外部文件,训练代理通过代码解释器自主检索解析,有效突破了 LLM 固定上下文窗口的限制,在复杂推理任务中表现优异。
AI 推荐理由
论文核心解决超长上下文限制,提出外部文件存储与检索机制,属于典型的记忆架构创新。
研究机构
Amazon
Duke University
论文信息