摘要
随着智能眼镜等可穿戴设备将大型多模态模型融入用户连续的第一人称视觉流,视觉个性化成为关键。本文形式化了个人视觉上下文学习(Personal VCL),即利用用户特定视觉上下文解决个性化查询的能力。通过构建 Personal-VCL-Bench 基准测试,发现现有模型在利用视觉证据方面存在显著差距。为此,作者提出了“代理上下文库”,这是一种强大的推理时基线方法,它将用户的视觉上下文结构化为自优化的记忆库,并采用查询自适应的证据选择机制,显著提升了个性化任务的表现。
AI 推荐理由
提出代理上下文库,构建自优化记忆银行以存储和利用用户视觉上下文,核心解决记忆机制问题。
研究机构
The University of Texas at Austin
论文信息