摘要
现代视觉语言模型的视觉感知受限于根本性的感知带宽瓶颈:广视野必然牺牲复杂推理所需的细粒度细节。受主动视觉和信息觅食经典范式启发,我们将克服此限制构建为序列决策过程,并通过序列贝叶斯最优实验设计问题进行形式化。针对连续千兆像素空间中精确贝叶斯推断的不可行性,我们推导了平衡空间覆盖与分辨率的原则性近似方法。为此,我们提出了一种无需训练的推理策略,作为配备多种视觉工具的智能体对该目标的实际实例化。该策略作为灵活模板,兼容从高效贪婪采样到前瞻规划等多种优化算法。在千兆像素级基准上的实证评估表明,该方法显著提升了最先进模型的性能,有效缩小了与人工标注预言机之间的差距。
AI 推荐理由
论文核心解决视觉语言模型因感知带宽瓶颈导致的复杂推理能力不足问题,通过序列实验设计提升推理性能。
研究机构
华南理工大学, 广东省广州市
清华大学, 北京市
论文信息