Multimodal LLM Arithmetic Reasoning Benchmark Computation vs Perception
摘要

多模态大语言模型虽能感知数值内容,但在跨模态执行精确多位乘法时表现失败。本文提出受控的多模态乘法基准,系统变化数字长度、稀疏度、表示形式及模态,并定义“算术负载”作为性能预测指标。评估显示准确率随负载增加急剧下降。感知与计算分解实验表明,性能退化主要源于计算而非感知缺陷。此外,通过强制完成损失探测,发现模型倾向于使用分解等启发式推理策略,且基础模型内部已具备优化的路由机制。

AI 推荐理由

论文核心研究多模态下精确算术推理能力的局限、计算负载与启发式策略。

研究机构
University of Texas at Austin National University of Singapore (NUS)
论文信息
作者 Samuel G. Balter, Ethan Jerzak, Connor T. Jerzak
发布日期 2026-04-20
arXiv ID 2604.18203
相关性评分 9/10 (高度相关)