摘要
传统多目标跟踪(MOT)侧重于估计视频中所有物体的轨迹,缺乏在语义指令下对用户指定目标的选择性推理。本文提出一种查询驱动的跟踪范式,将跟踪表述为以自然语言查询为条件的时空推理问题。给定参考帧、视频序列和文本查询,目标是定位并跟踪查询指定的目标,同时保持时间连贯性和身份一致性。为此,我们构建了 RMOT26 基准,并提出端到端视觉 - 语言模型 QTrack,集成多模态推理与跟踪导向定位。此外,引入时间感知策略优化方法,通过结构化奖励鼓励运动感知推理。实验证明了该方法在推理中心、语言引导跟踪中的有效性。
AI 推荐理由
论文核心是将多目标跟踪重构为时空推理问题,提出查询驱动的推理范式及优化策略。
研究机构
国王阿卜杜拉科技大学(KAUST),沙特阿拉伯
塔巴尔工程与技术学院,印度
昆士兰大学,澳大利亚
印度国家技术研究所盖什研究实验室,印度
论文信息