反射记忆 图像描述 多智能体 幻觉抑制 视觉语言模型
摘要

详细图像描述需兼顾事实准确性与细粒度覆盖,现有方法难以两全。本文提出反射笔记引导描述生成法(ReflectCAP),利用多智能体流水线分析大视觉语言模型的幻觉与遗漏模式,提炼为可复用的结构化反思笔记。推理时,这些笔记引导模型规避错误并关注细节,显著提升描述质量。实验表明,该方法在事实性与覆盖率权衡上达到帕累托最优,且计算成本低于模型扩展或其他多智能体方案。

AI 推荐理由

论文核心提出“反射记忆”机制,通过结构化反思笔记指导模型,属于典型的记忆增强架构。

研究机构
IPAI, Seoul National University Dept. of ECE, Seoul National University Adobe Research
论文信息
作者 Kyungmin Min, Minbeom Kim, Kang-il Lee, Seunghyun Yoon, Kyomin Jung
发布日期 2026-04-14
arXiv ID 2604.12357
相关性评分 9/10 (高度相关)