Long-Context Agent Framework RLVR E-commerce External Memory
摘要

理解客户购物轨迹对个性化体验至关重要,但跨多年的超长记录给现有大模型带来巨大挑战。针对现有基准仅限短轨迹且真实数据稀缺的问题,本文构建了 ShopTrajQA 基准,包含长达 64k token 的模拟轨迹。研究揭示了前沿模型在长轨迹推理上的不足,并提出 Customer Agent 框架。该框架利用可验证奖励的强化学习(RLVR),将轨迹存储为外部文件,训练代理通过代码解释器自主检索解析,有效突破了 LLM 固定上下文窗口的限制,在复杂推理任务中表现优异。

AI 推荐理由

论文核心解决超长上下文限制,提出外部文件存储与检索机制,属于典型的记忆架构创新。

研究机构
Amazon Duke University
论文信息
作者 Hongye Liu, Rongmei Lin, Anurag Kashyap, Hejie Cui, Ricardo Henao et al.
发布日期 2026-06-06
arXiv ID 2606.07995
相关性评分 9/10 (高度相关)