Long-Term Memory In-Vehicle Agents Benchmark Multi-User Interaction
摘要

随着车内智能体验需求增长,车载智能体正从简单助手演变为长期伴侣,需持续建模多用户偏好并处理偏好冲突及习惯变迁。现有基准多局限于单用户静态问答,无法捕捉偏好时序演化及真实车环境的工具交互特性。为此,本文提出 VehicleMemBench,这是一个基于可执行车内仿真环境构建的多用户长上下文记忆基准。该基准通过对比动作后环境状态与预设目标状态来评估工具使用与记忆能力,实现了无需大模型或人工评分的客观可复现评估。实验表明,强大模型在直接指令任务表现良好,但在涉及记忆演化尤其是用户偏好动态变化场景中表现欠佳,凸显了开发更鲁棒专用记忆管理机制的必要性。

AI 推荐理由

论文核心聚焦车载智能体多用户长期记忆机制,提出专用基准评估记忆演化与冲突处理。

研究机构
厦门大学 中国科学院大学 飞桨研究团队
论文信息
作者 Yuhao Chen, Yi Xu, Xinyun Ding, Xiang Fang, Shuochen Liu et al.
发布日期 2026-03-25
arXiv ID 2603.23840
相关性评分 9/10 (高度相关)