摘要
针对多模态大模型在多图像推理中局部化视觉证据的局限性,本文提出 ROVER,一种轻量级可学习插件。该方法通过注入特定步骤的令牌三元组,协同聚合推理上下文、利用对象中心差分注意力提炼图像内线索,并在视觉工作空间中路由整合跨对象及跨图像的历史感知证据。实验表明,ROVER 在 MM-GCoT 和 VideoEspresso 基准上显著提升了回答与定位准确率,且具备强大的迁移能力。
AI 推荐理由
论文核心解决多图像场景下的视觉证据路由与 grounded 推理问题,显著提升推理准确率。
研究机构
Kuaishou Technology
论文信息