Visual Reasoning In-Context Learning Causal Inference Counterfactuals
摘要

视觉语言模型在多模态推理任务中表现优异,但常难以解耦细粒度视觉属性及推理潜在因果关系。现有上下文学习依赖被动相似性检索,易选取非因果相关示例,放大虚假关联。本文提出 CIRCLES 框架,通过属性引导的组合图像检索,主动构建包含反事实风格的演示集。该方法使模型能隐式推理属性与结果间的因果关系,超越表面相关性。实验表明,CIRCLES 在多种架构及数据稀缺场景下均显著优于现有方法,提升了推理的鲁棒性与 grounded 性。

AI 推荐理由

论文核心在于通过反事实检索增强 VLM 的因果推理能力,解决细粒度属性解耦难题。

研究机构
弗吉尼亚大学
论文信息
作者 Guangzhi Xiong, Sanchit Sinha, Zhenghao He, Aidong Zhang
发布日期 2026-03-17
arXiv ID 2603.16737
相关性评分 9/10 (高度相关)