摘要
针对现有推理分割流程无法透明连接语言推理与视觉感知的问题,本文提出 SegCompass 模型。该方法利用稀疏自编码器(SAE)将思维链(CoT)与视觉令牌映射至共享的高维稀疏概念空间,构建显式、可解释且可微的对齐路径。通过查询码本选择显著概念并经由槽位映射器生成空间热力图,指导最终掩码解码。模型联合训练,统一了推理路径的强化学习与标准分割监督。实验表明,该方法在多个基准上达到或超越最先进水平,且 learned 稀疏概念质量与分割精度高度相关,实现了优越的可 inspectable 对齐。
AI 推荐理由
论文核心在于通过稀疏自编码器实现思维链与视觉的可解释对齐,直接增强推理分割能力。
研究机构
深圳先进技术研究院
中国科学院大学
北京航空航天大学
论文信息