摘要
多模态大语言模型虽能感知数值内容,但在跨模态执行精确多位乘法时表现失败。本文提出受控的多模态乘法基准,系统变化数字长度、稀疏度、表示形式及模态,并定义“算术负载”作为性能预测指标。评估显示准确率随负载增加急剧下降。感知与计算分解实验表明,性能退化主要源于计算而非感知缺陷。此外,通过强制完成损失探测,发现模型倾向于使用分解等启发式推理策略,且基础模型内部已具备优化的路由机制。
AI 推荐理由
论文核心研究多模态下精确算术推理能力的局限、计算负载与启发式策略。
研究机构
University of Texas at Austin
National University of Singapore (NUS)
论文信息