Multimodal Reasoning Multi-Agent System Visual Perception Math Reasoning
摘要

多模态大语言模型在视觉数学推理中表现优异,但常受限于不准确的视觉感知。研究发现,失败主因是视觉证据提取错误而非推理能力不足,且模型对初始感知过度自信。为此,本文提出 M$^3$-ACE 框架,通过解耦感知与推理,利用多智能体动态维护共享视觉证据上下文以纠正错误。引入摘要与精炼工具支持稳定协作。实验表明,该方法在 MathVision 等基准上取得最先进结果,显著提升了多模态推理性能。

AI 推荐理由

论文核心解决多模态数学推理中的视觉感知瓶颈,通过多智能体协作提升推理准确性。

研究机构
TITNLPLab, 哈尔滨工业大学 平台与内容组, 腾讯
论文信息
作者 Peijin Xie, Zhen Xu, Bingquan Liu, Baoxun Wang
发布日期 2026-03-09
arXiv ID 2603.08369
相关性评分 9/10 (高度相关)