Reasoning Segmentation Interpretability Sparse Autoencoder Chain-of-Thought Multimodal Alignment
摘要

针对现有推理分割流程无法透明连接语言推理与视觉感知的问题,本文提出 SegCompass 模型。该方法利用稀疏自编码器(SAE)将思维链(CoT)与视觉令牌映射至共享的高维稀疏概念空间,构建显式、可解释且可微的对齐路径。通过查询码本选择显著概念并经由槽位映射器生成空间热力图,指导最终掩码解码。模型联合训练,统一了推理路径的强化学习与标准分割监督。实验表明,该方法在多个基准上达到或超越最先进水平,且 learned 稀疏概念质量与分割精度高度相关,实现了优越的可 inspectable 对齐。

AI 推荐理由

论文核心在于通过稀疏自编码器实现思维链与视觉的可解释对齐,直接增强推理分割能力。

研究机构
深圳先进技术研究院 中国科学院大学 北京航空航天大学
论文信息
作者 Zhenyu Lu, Liupeng Li, Jinpeng Wang, Haoqian Kang, Yan Feng et al.
发布日期 2026-05-21
arXiv ID 2605.22658
相关性评分 9/10 (高度相关)