LLM 可靠性 逻辑推理 计数能力 规则遵循
摘要

大型语言模型在数学推理等基准测试中表现优异,但其成功源于通用逻辑能力还是模式匹配尚不明确。本文提出“稳定计数容量”评估方法,通过让模型计数重复符号直至失败,排除知识与语义干扰,直接测量程序可靠性。实验涵盖百余种模型变体,结果显示其稳定计数能力远低于标称上下文限制。模型行为并非基于开放逻辑或稳定规则应用,而是依赖有限的内部状态;资源耗尽后,精确执行即退化为猜测。这表明当前的流畅性能并不能保证通用且可靠的规则遵循能力。

AI 推荐理由

论文核心探究 LLM 的逻辑推理本质,通过计数任务揭示其规则执行能力的局限性。

研究机构
斯坦福大学电气工程系
论文信息
作者 Tianxiang Dai, Jonathan Fan
发布日期 2026-05-03
arXiv ID 2605.02028
相关性评分 9/10 (高度相关)