摘要
详细图像描述需兼顾事实准确性与细粒度覆盖,现有方法难以两全。本文提出反射笔记引导描述生成法(ReflectCAP),利用多智能体流水线分析大视觉语言模型的幻觉与遗漏模式,提炼为可复用的结构化反思笔记。推理时,这些笔记引导模型规避错误并关注细节,显著提升描述质量。实验表明,该方法在事实性与覆盖率权衡上达到帕累托最优,且计算成本低于模型扩展或其他多智能体方案。
AI 推荐理由
论文核心提出“反射记忆”机制,通过结构化反思笔记指导模型,属于典型的记忆增强架构。
研究机构
IPAI, Seoul National University
Dept. of ECE, Seoul National University
Adobe Research
论文信息