摘要
视觉异常检测(VAD)在工业、医疗等领域至关重要,但跨域迁移困难。视觉语言模型(VLM)虽具潜力,但单次推断可靠性不足。本文提出 AnomalyClaw,一种无需训练的 VAD 智能体,将异常判断转化为多轮反驳过程:每轮提出候选异常并对照正常样本参考进行证伪,利用包含 13 种工具的库进行视觉验证与专家探测。实验表明该方法显著优于单步推断。此外,引入可选的口语化自我进化扩展,通过内部支路分歧构建在线规则书,在无标签情况下进一步提升性能。
AI 推荐理由
论文核心是通过多轮反驳过程提升视觉异常检测中的推理与判断能力,而非单纯调用工具。
研究机构
Department of Computer Science and Engineering, Southern University of Science and Technology (SUSTech), Shenzhen, China
School of EEE, Nanyang Technological University (NTU), Singapore
CFAR, Agency for Science, Technology and Research (A*STAR), Singapore
论文信息