摘要
高质量视觉问答与定位(VQA-G)数据集的手动标注对推进视觉语言模型至关重要,但难以扩展。现有自动化方法常受限于模型幻觉导致的数据一致性差,以及基于简单启发式的脆弱验证机制。为此,本文提出 AutoVQA-G,一种用于自动 VQA-G 标注的自我改进智能体框架。该框架采用迭代优化循环:一致性评估模块利用思维链推理进行细粒度视觉验证;基于反馈,记忆增强的提示优化智能体分析失败样本的批评意见,逐步精炼生成提示。实验表明,该方法生成的数据集在视觉定位准确性上优于主流多模态大模型。
AI 推荐理由
论文提出自我改进框架,通过迭代优化提示和反思失败样本实现系统进化。
研究机构
School of Artificial Intelligence and Computer Science, Jiangnan University, Wuxi, China
Thrust of Artificial Intelligence, HKUST(GZ), Guangzhou, China
论文信息