摘要
视觉语言模型在邦加德问题等抽象视觉推理基准上常表现不佳,其主要瓶颈在于推理还是表征尚存争议。本研究利用带有真实生成程序的邦加德 -LOGO 基准,对比端到端视觉模型与接收符号输入的 LLM。提出的成分 - 语法范式将任务重构为基于符号动作程序的推理任务。实验显示,LLM 在符号输入下准确率大幅提升至 90% 以上,而视觉基线仍接近随机猜测。结果表明,从像素到符号结构的转变是关键,表征是抽象视觉推理的主要瓶颈。
AI 推荐理由
论文核心研究抽象视觉推理中的表征瓶颈,通过符号输入诊断并显著提升 LLM 推理性能。
研究机构
Applied Artificial Intelligence Group, Tallinn University of Technology, Estonia 12169
Kimova AI, Tallinn, Estonia 10113
论文信息