摘要
近期视频大语言模型在长视频理解任务中取得进展,但仍存在证据获取依赖单一搜索意图及答案生成缺乏有效视觉反馈机制两大局限。为此,本文提出 CoVER 框架,旨在实现“看得更多”与“想得更深”。该框架通过动态收集查询扩展的视觉证据,并利用特定答案的视觉反馈验证草稿答案,将长视频理解从以答案为中心的生成转变为以证据为中心且可视觉验证的推理过程。实验表明,CoVER-7B 显著优于同参数量模型,并在部分指标上超越最先进的闭源模型。
AI 推荐理由
论文提出基于视觉反馈的反思机制,核心在于提升长视频理解中的证据中心推理能力。
研究机构
1Baidu Inc.
2Harbin Institute of Technology
3Hong Kong University of Science and Technology
论文信息