摘要
多模态大语言模型(MLLMs)在异常检测中展现了卓越的推理与感知能力,但现有方法多局限于图像级检测与文本推理,像素级定位仍依赖外部视觉模块及密集标注。本文提出推理驱动异常定位(ReAL)方法,仅利用图像级监督,通过提取自回归推理过程中的异常相关令牌并聚合其注意力响应,生成像素级异常图谱,无需辅助组件或像素级标签。此外,引入一致性引导推理优化(CGRO)模块,利用强化学习对齐推理令牌与视觉注意力,提升推理连贯性与定位精度。实验表明,该方法在多个基准上显著优于同类技术。
AI 推荐理由
论文核心在于激活 MLLM 的内在推理潜能,利用自回归推理过程实现异常定位。
研究机构
State Key Laboratory of Virtual Reality Technology and Systems, Beihang University, Beijing, China
Hangzhou Innovation Institute, Beihang University, Hangzhou, China
论文信息