摘要
多模态大语言模型在复杂视觉任务中展现出巨大潜力,但在视频问答中,延长的思维链过程常因“视觉锚点漂移”导致性能下降,即模型过度依赖自生成文本而忽视视觉输入。现有方法通常引入特定机制让模型在推理时重新关注视觉信息,但往往训练成本高昂且泛化性差。为此,本文提出 FrameRepeat,一种自动化增强框架,包含轻量级重复评分模块,使视频大模型能自主识别需强化的关键帧。我们引入“加一入”(AOI)训练策略,利用模型输出概率生成监督信号以训练帧评分网络,指导帧重复行为。实验表明该方法在多个模型和数据集上均有效且具泛化性。
AI 推荐理由
论文核心解决视频推理中的视觉遗忘问题,通过帧重复机制增强思维链过程中的视觉锚点。
研究机构
中国科学院大学
中国科学院自动化研究所认知智能国家重点实验室
论文信息