摘要
尽管多模态架构取得进展,视觉空间推理(VSR)仍是现代视觉语言模型的挑战。常见策略是在推理时注入额外信息,如显式空间线索、外部常识知识或思维链指令。然而,这些信息何时真正提升推理、何时引入噪声尚不明确。本文通过假设驱动的分析,在三个代表性模型和两个基准上研究了空间上下文类型数量、注入常识知识的相关性及空间 grounding 与思维链的交互。结果表明,更多信息未必带来更好推理:针对性单一线索优于多上下文聚合,过量或弱相关常识降低性能,仅当空间定位足够精确时思维链才提升准确率。
AI 推荐理由
论文核心研究视觉空间推理中信息注入对推理能力的影响机制,直接针对推理效能。
研究机构
墨尔本大学
论文信息