摘要
本文首次系统分析了多模态大语言模型(MLLM)在需要自我定位的个性化问答任务中的表现。为此,作者推出了 MyEgo,这是首个旨在评估 MLLM 理解、记忆及推理摄像头佩戴者信息的第一人称视频问答数据集。基准测试显示,各类主流模型在此任务上表现不佳,准确率远低于人类水平。研究发现,显式推理或模型扩展并未带来一致提升,而提供相关证据虽能短期改善性能,但随时间推移效果递减,揭示了模型在追踪和记忆“自我”及“过去”方面的局限性,突显了长期记忆在该领域的重要性。
AI 推荐理由
论文核心评估 MLLM 在长视频中对“自我”历史信息的记忆与追踪能力,明确指出长期记忆是关键瓶颈。
研究机构
University of Science and Technology of China
National University of Singapore
论文信息