self-improving VQA-G agent framework data annotation prompt optimization
摘要

高质量视觉问答与定位(VQA-G)数据集的手动标注对推进视觉语言模型至关重要,但难以扩展。现有自动化方法常受限于模型幻觉导致的数据一致性差,以及基于简单启发式的脆弱验证机制。为此,本文提出 AutoVQA-G,一种用于自动 VQA-G 标注的自我改进智能体框架。该框架采用迭代优化循环:一致性评估模块利用思维链推理进行细粒度视觉验证;基于反馈,记忆增强的提示优化智能体分析失败样本的批评意见,逐步精炼生成提示。实验表明,该方法生成的数据集在视觉定位准确性上优于主流多模态大模型。

AI 推荐理由

论文提出自我改进框架,通过迭代优化提示和反思失败样本实现系统进化。

研究机构
School of Artificial Intelligence and Computer Science, Jiangnan University, Wuxi, China Thrust of Artificial Intelligence, HKUST(GZ), Guangzhou, China
论文信息
作者 Rongsheng Hu, Runwei Guan, Yicheng Di, Jiayu Bao, Yuan Liu
发布日期 2026-04-19
arXiv ID 2604.17488
相关性评分 9/10 (高度相关)