Video Reasoning Segmentation Multimodal LLM Trajectory Alignment
摘要

多模态大语言模型的繁荣激发了视频推理分割的需求,旨在依据人类指令分割视频对象。针对现有研究在剧烈视频动态下难以感知轨迹的问题,本文提出 TrajSeg 框架。该框架引入双向文本 - 轨迹对齐机制,使模型能同时处理接地和描述指令,从而增强对应关系并提升轨迹感知能力。通过帧级内容集成模块和统一掩码解码器,实现了从轨迹到掩码的生成及端到端训练。实验表明,该方法在所有指标上均优于现有视频推理分割方法。

AI 推荐理由

论文核心解决视频推理分割任务,通过双向对齐增强模型对轨迹的感知与推理能力。

研究机构
中国科学院自动化研究所
论文信息
作者 Jingnan Luo, Mingqi Gao, Jun Liu, Bin-Bin Gao, Feng Zheng
发布日期 2026-03-23
arXiv ID 2603.21488
相关性评分 9/10 (高度相关)