Video Reasoning Active Perception Chain-of-Thought VLM
摘要

视觉语言模型通常依赖静态初始帧进行视频推理,限制了动态信息的整合。现有方法虽在思维链中增加帧信息,但质量欠佳且缺乏合成假设场景视觉信息的能力。本文提出 Act2See 框架,通过在文本思维链中交错插入视频帧,赋予模型主动视觉感知能力。该模型经高质量推理轨迹监督微调,能自主决定检索或合成视觉证据。实验表明,Act2See 在多个基准测试中取得最先进结果,显著提升了视频推理性能。

AI 推荐理由

论文核心在于通过主动视觉感知增强视频推理中的思维链质量,直接提升推理能力。

研究机构
Carnegie Mellon University MIT
论文信息
作者 Martin Q. Ma, Yuxiao Qu, Aditya Agrawal, Willis Guo, Paul Pu Liang et al.
发布日期 2026-05-03
arXiv ID 2605.01657
相关性评分 9/10 (高度相关)