摘要
视觉语言模型在图像文本检索表现优异,但在区分词汇相同但关系结构不同的组合推理任务中持续失败。本文提出统一评估与增强框架,在 Winoground 基准上测试了四种架构多样的模型。我们引入基于依赖的文本场景图解析器提取主谓宾三元组,并利用图不对称评分器注入结构关系先验。实验表明,Qwen3-VL-8B-Thinking 结合多轮场景图过滤策略取得了 66.0 的分组得分,超越现有开源最先进水平。分析发现,场景图增强仅对已有能力的模型有益,对弱基线收益甚微或为负。
AI 推荐理由
论文核心研究推理时结构增强以提升组合推理能力,直接针对推理机制。
研究机构
生物医学数据科学,盖塞尔医学院,达特茅斯学院
论文信息