摘要
视频理解需跨帧识别并推理语义判别性视觉对象,但现有方案难以应对随时间变化的对象差异。为此,本文提出 Chain-of-Glimpse,一种搜索引导的渐进式对象基推理框架,将每一步推理显式锚定于特定视觉证据区域,以实现组合式多步决策。该方法通过强化学习优化搜索控制器,利用格式奖励激励接地能力,迭代构建可靠推理轨迹。在 NExTQA 及多个域外基准上的评估表明,该方法在多样性视频推理任务中具有一致的性能提升、鲁棒性及泛化能力。
AI 推荐理由
论文提出基于搜索的渐进式推理框架,核心解决视频理解中的多步逻辑推理与证据锚定问题。
研究机构
中国科学院自动化研究所
论文信息