摘要
大型多模态模型虽推动了工业异常检测,但缺乏领域知识限制了其在复杂场景中的准确性。本文提出 JUDO 框架,高效融合领域知识与上下文进行视听推理。该模型通过将查询图像与正常图像并置作为视觉上下文,实现细粒度缺陷分割;同时利用监督微调注入领域知识,并通过带有定制奖励的强化学习引导领域导向的推理过程。实验表明,JUDO 在 MMAD 基准上表现优异,超越了 Qwen2.5-VL-7B 和 GPT-4o,证明了增强领域知识对异常理解推理的重要性。
AI 推荐理由
论文核心提出多模态推理框架,通过视觉对比和强化学习优化领域推理过程。
研究机构
Sungkyunkwan University
Seoul National University
论文信息