MLLM 异常检测 推理驱动 弱监督学习 像素级定位
摘要

多模态大语言模型(MLLMs)在异常检测中展现了卓越的推理与感知能力,但现有方法多局限于图像级检测与文本推理,像素级定位仍依赖外部视觉模块及密集标注。本文提出推理驱动异常定位(ReAL)方法,仅利用图像级监督,通过提取自回归推理过程中的异常相关令牌并聚合其注意力响应,生成像素级异常图谱,无需辅助组件或像素级标签。此外,引入一致性引导推理优化(CGRO)模块,利用强化学习对齐推理令牌与视觉注意力,提升推理连贯性与定位精度。实验表明,该方法在多个基准上显著优于同类技术。

AI 推荐理由

论文核心在于激活 MLLM 的内在推理潜能,利用自回归推理过程实现异常定位。

研究机构
State Key Laboratory of Virtual Reality Technology and Systems, Beihang University, Beijing, China Hangzhou Innovation Institute, Beihang University, Hangzhou, China
论文信息
作者 Yizhou Jin, Yuezhu Feng, Jinjin Zhang, Peng Wang, Qingjie Liu et al.
发布日期 2026-03-28
arXiv ID 2603.27179
相关性评分 9/10 (高度相关)