摘要
视觉语言模型通常依赖静态初始帧进行视频推理,限制了动态信息的整合。现有方法虽在思维链中增加帧信息,但质量欠佳且缺乏合成假设场景视觉信息的能力。本文提出 Act2See 框架,通过在文本思维链中交错插入视频帧,赋予模型主动视觉感知能力。该模型经高质量推理轨迹监督微调,能自主决定检索或合成视觉证据。实验表明,Act2See 在多个基准测试中取得最先进结果,显著提升了视频推理性能。
AI 推荐理由
论文核心在于通过主动视觉感知增强视频推理中的思维链质量,直接提升推理能力。
研究机构
Carnegie Mellon University
MIT
论文信息