多模态推理 工业异常检测 领域知识增强 强化学习
摘要

大型多模态模型虽推动了工业异常检测,但缺乏领域知识限制了其在复杂场景中的准确性。本文提出 JUDO 框架,高效融合领域知识与上下文进行视听推理。该模型通过将查询图像与正常图像并置作为视觉上下文,实现细粒度缺陷分割;同时利用监督微调注入领域知识,并通过带有定制奖励的强化学习引导领域导向的推理过程。实验表明,JUDO 在 MMAD 基准上表现优异,超越了 Qwen2.5-VL-7B 和 GPT-4o,证明了增强领域知识对异常理解推理的重要性。

AI 推荐理由

论文核心提出多模态推理框架,通过视觉对比和强化学习优化领域推理过程。

研究机构
Sungkyunkwan University Seoul National University
论文信息
作者 Hyunju Kang, Woohyun Lee, Jaewon Kim, Hogun Park
发布日期 2026-05-19
arXiv ID 2605.20284
相关性评分 9/10 (高度相关)