摘要
视频大语言模型(Video-LLMs)需通过持续学习适应非平稳现实数据。现有基准多依赖未预训练模型或任务冗余高,难以评估遗忘问题。本文提出 CL-VISTA 基准,涵盖感知、理解与推理等八项多样任务,引发显著分布偏移以暴露灾难性遗忘。建立包含性能、计算效率及内存占用的三维评估框架。实验表明,现有方法在缓解遗忘与保持泛化能力及资源效率间存在根本权衡,无单一方案具普遍优势。
AI 推荐理由
论文聚焦持续学习以应对数据分布变化,属 Agent 自我适应与进化核心范畴。
研究机构
中国科学院大学先进技术交叉科学学院
中国科学院自动化研究所
香港科技大学-广州校区人工智能与机器人中心
厦门大学计算机科学与技术学院
论文信息