摘要
针对现有视频理解数据集缺乏自然生活场景的问题,本文推出 MM-Lifelong 数据集,涵盖天、周、月不同时间尺度。评估发现当前范式存在工作记忆瓶颈和全局定位崩溃两大缺陷。为此,作者提出递归多模态智能体(ReMA),利用动态记忆管理迭代更新递归信念状态,显著优于现有方法。此外,研究还建立了隔离时间与领域偏差的数据集划分,为监督学习和分布外泛化研究奠定基础。
AI 推荐理由
论文核心解决多模态长时理解中的工作记忆瓶颈,提出动态记忆管理机制。
研究机构
南京大学
NVIDIA
东京大学
论文信息