摘要
大型语言模型在数学推理基准测试中表现优异,但在问题名称或数字发生简单变化时性能显著下降。尽管代码执行方法被提出作为解决方案,但其对推理鲁棒性的影响尚未得到系统测试。本研究利用 GSM-Symbolic 数据集的 1000 个问题,评估了思维链提示、单次代码执行及迭代代码执行三种方法。结果显示,纯推理方法在面对扰动时最具鲁棒性,而代码执行并未显著提升 grade-school 级别问题变体的推理稳定性。
AI 推荐理由
论文核心评估 LLM 在数学推理中的鲁棒性,对比纯推理与代码执行效果。
研究机构
未提供具体单位
论文信息