Multimodal Reasoning Visual Tools Perception Programs MLLM
摘要

多模态语言模型常结合视觉工具增强推理,但原始像素级输出与语言原生推理优势错位,导致感知薄弱。本文提出感知程序(P²),一种无需训练、模型无关的方法,将工具输出重写为紧凑的结构化语言摘要,使模型能直接解析推理。在 BLINK 六个任务中,P² 显著超越基线及现有方法,即使在小模型上也取得 15-40% 的绝对增益,确立了新的最先进结果。

AI 推荐理由

论文核心解决视觉工具输出与语言模型推理能力不对齐问题,显著提升多模态推理性能。

研究机构
Huawei Technologies, Canada University of Alberta, Canada
论文信息
作者 Muhammad Kamran Janjua, Hugo Silva, Di Niu, Bahador Rashidi
发布日期 2026-04-14
arXiv ID 2604.12896
相关性评分 9/10 (高度相关)