摘要
多模态大语言模型在视觉数学推理中表现优异,但常受限于不准确的视觉感知。研究发现,失败主因是视觉证据提取错误而非推理能力不足,且模型对初始感知过度自信。为此,本文提出 M$^3$-ACE 框架,通过解耦感知与推理,利用多智能体动态维护共享视觉证据上下文以纠正错误。引入摘要与精炼工具支持稳定协作。实验表明,该方法在 MathVision 等基准上取得最先进结果,显著提升了多模态推理性能。
AI 推荐理由
论文核心解决多模态数学推理中的视觉感知瓶颈,通过多智能体协作提升推理准确性。
研究机构
TITNLPLab, 哈尔滨工业大学
平台与内容组, 腾讯
论文信息