Arithmetic Reasoning Robustness Evaluation Adversarial Attacks LLM Generalization
摘要

大型语言模型在算术推理基准上表现优异,但在无需外部工具直接处理自然语言时仍显脆弱。现有研究表明模型对数值变化敏感。本文提出一种自动生成数值重映射攻击的算法,通过推导特定问题的符号表示、生成受约束的数值重映射并重新计算标准答案,以测试模型在保持推理逻辑不变情况下的鲁棒性。实验显示,GSM8K 数据集上的模型准确率显著下降,而结构更规则的数据集则表现稳定,表明算术推理的鲁棒性高度依赖于数据集结构。

AI 推荐理由

论文核心研究 LLM 在算术推理中的泛化能力与数值鲁棒性,直接评估推理机制。

研究机构
Department of Computer Science, Boise State University, Boise, ID, USA University of L'Aquila, L'Aquila, Italy
论文信息
作者 Malia Barker, Bishal Lakha, Edoardo Serra, Francesco Gullo
发布日期 2026-06-02
arXiv ID 2606.03606
相关性评分 9/10 (高度相关)