Abstract Visual Reasoning Symbolic Grounding Representation Bottleneck Bongard-LOGO
摘要

视觉语言模型在邦加德问题等抽象视觉推理基准上常表现不佳,其主要瓶颈在于推理还是表征尚存争议。本研究利用带有真实生成程序的邦加德 -LOGO 基准,对比端到端视觉模型与接收符号输入的 LLM。提出的成分 - 语法范式将任务重构为基于符号动作程序的推理任务。实验显示,LLM 在符号输入下准确率大幅提升至 90% 以上,而视觉基线仍接近随机猜测。结果表明,从像素到符号结构的转变是关键,表征是抽象视觉推理的主要瓶颈。

AI 推荐理由

论文核心研究抽象视觉推理中的表征瓶颈,通过符号输入诊断并显著提升 LLM 推理性能。

研究机构
Applied Artificial Intelligence Group, Tallinn University of Technology, Estonia 12169 Kimova AI, Tallinn, Estonia 10113
论文信息
作者 Mohit Vaishnav, Tanel Tammet
发布日期 2026-04-23
arXiv ID 2604.21346
相关性评分 9/10 (高度相关)