摘要
大型视觉语言模型在视频理解方面进展显著,但在需要精确时空定位的实例级任务中仍面临挑战。现有方法依赖文本提示,难以提供精准参考,且常将视觉感知与语言推理解耦。为此,本文提出 VideoSeeker,一种通过视觉提示进行实例级视频理解的新范式。该模型无缝集成智能体推理,能主动按需感知和检索视频片段。通过四阶段自动化数据合成及冷启动监督与强化学习训练,模型内化了工具调用与主动感知能力。实验表明,其在实例级任务上平均提升 13.7%,超越 GPT-4o 等闭源模型,并具备良好迁移性。
AI 推荐理由
论文核心在于通过原生智能体工具调用(Tool Invocation)实现视频实例级理解,属技能学习范畴。
研究机构
East China Normal University
Xi'an Jiaotong University
Xiaohongshu Inc.
论文信息