Video Understanding Agent Tool Use LVLM Reinforcement Learning
摘要

大型视觉语言模型在视频理解方面进展显著,但在需要精确时空定位的实例级任务中仍面临挑战。现有方法依赖文本提示,难以提供精准参考,且常将视觉感知与语言推理解耦。为此,本文提出 VideoSeeker,一种通过视觉提示进行实例级视频理解的新范式。该模型无缝集成智能体推理,能主动按需感知和检索视频片段。通过四阶段自动化数据合成及冷启动监督与强化学习训练,模型内化了工具调用与主动感知能力。实验表明,其在实例级任务上平均提升 13.7%,超越 GPT-4o 等闭源模型,并具备良好迁移性。

AI 推荐理由

论文核心在于通过原生智能体工具调用(Tool Invocation)实现视频实例级理解,属技能学习范畴。

研究机构
East China Normal University Xi'an Jiaotong University Xiaohongshu Inc.
论文信息
作者 Yiming Zhao, Yu Zeng, Wenxuan Huang, Zhen Fang, Qing Miao et al.
发布日期 2026-05-15
arXiv ID 2605.16079
相关性评分 9/10 (高度相关)