摘要
本文研究了个人相册视觉问答场景,其中对话式 AI 助手需访问用户相册以回答从事实性到开放式的各类查询。面对跨越数年、包含数千张照片的海量数据,助手必须理解长程且高度个性化的视觉内容流。为此,我们构建了包含 50 名用户、3 万余张图像及 2500 个问答对的 camroll 数据集,并设计了配备分层记忆机制与最小工具集的 camroll-agent。实验表明,该系统在长上下文理解任务上显著优于现有基线,揭示了个性化视觉记忆与传统文本长上下文记忆在处理一致性与细节时的本质差异。
AI 推荐理由
论文核心提出分层记忆架构以管理个人视觉流,解决长程个性化记忆检索难题。
研究机构
University of Wisconsin-Madison
Korea University
Adobe Research
论文信息