摘要
多模态大语言模型的繁荣激发了视频推理分割的需求,旨在依据人类指令分割视频对象。针对现有研究在剧烈视频动态下难以感知轨迹的问题,本文提出 TrajSeg 框架。该框架引入双向文本 - 轨迹对齐机制,使模型能同时处理接地和描述指令,从而增强对应关系并提升轨迹感知能力。通过帧级内容集成模块和统一掩码解码器,实现了从轨迹到掩码的生成及端到端训练。实验表明,该方法在所有指标上均优于现有视频推理分割方法。
AI 推荐理由
论文核心解决视频推理分割任务,通过双向对齐增强模型对轨迹的感知与推理能力。
研究机构
中国科学院自动化研究所
论文信息