摘要
针对基于知识的视觉问答(KB-VQA)中现有检索增强生成方法流程固定、检索与推理分离导致适应性差的问题,本文将其重构为搜索智能体问题。该方法将求解过程建模为多步决策程序,智能体根据当前信息状态在回答、图像检索、文本检索和生成描述四种动作中动态选择。此外,作者设计了自动化流水线收集包含推理过程和工具使用的多步轨迹数据,用于监督微调。实验表明,该方法在 InfoSeek 和 E-VQA 数据集上均取得了最先进的性能。
AI 推荐理由
论文将任务建模为多步决策过程,核心在于动态规划搜索策略(何时搜、如何搜、何时停)。
研究机构
清华大学
Arizona大学
合肥工业大学
论文信息