摘要
多模态大语言模型虽推动了视频推理发展,但视频问答仍面临时序因果推理与证据 grounded 答案生成的挑战。现有端到端框架缺乏显式结构化推理,导致严重幻觉且可解释性差。受人类分层视觉认知启发,本文提出 ClueNet,一种感知线索的视频推理框架。该方法采用两阶段监督微调范式,解耦监督对齐线索提取与链式推理,并结合自适应线索过滤优化高阶推理。实验表明,ClueNet 在多个基准上超越最先进方法,显著减少幻觉并提升推理效率与泛化能力。
AI 推荐理由
论文核心提出基于视觉线索的视频推理框架,解决因果推理与幻觉问题。
研究机构
中国科学院空天信息创新研究院
中国科学院大学
论文信息