多模态推理 视觉语言模型 多目标跟踪 时空推理
摘要

传统多目标跟踪(MOT)侧重于估计视频中所有物体的轨迹,缺乏在语义指令下对用户指定目标的选择性推理。本文提出一种查询驱动的跟踪范式,将跟踪表述为以自然语言查询为条件的时空推理问题。给定参考帧、视频序列和文本查询,目标是定位并跟踪查询指定的目标,同时保持时间连贯性和身份一致性。为此,我们构建了 RMOT26 基准,并提出端到端视觉 - 语言模型 QTrack,集成多模态推理与跟踪导向定位。此外,引入时间感知策略优化方法,通过结构化奖励鼓励运动感知推理。实验证明了该方法在推理中心、语言引导跟踪中的有效性。

AI 推荐理由

论文核心是将多目标跟踪重构为时空推理问题,提出查询驱动的推理范式及优化策略。

研究机构
国王阿卜杜拉科技大学(KAUST),沙特阿拉伯 塔巴尔工程与技术学院,印度 昆士兰大学,澳大利亚 印度国家技术研究所盖什研究实验室,印度
论文信息
作者 Tajamul Ashraf, Tavaheed Tariq, Sonia Yadav, Abrar Ul Riyaz, Wasif Tak et al.
发布日期 2026-03-14
arXiv ID 2603.13759
相关性评分 9/10 (高度相关)