deterministic computation prompting strategies Program-of-Thought symbolic reasoning
摘要

大语言模型在自然语言理解与推理方面表现出色,但其执行精确确定性计算的能力尚不明确。本文系统评估了思维链、由简入繁分解、思维程序及自一致性等多种提示策略在二进制计数、最长子串检测及算术评估等需零误差任务上的表现。研究构建了合成数据集以支持受控评估。结果显示,标准提示方法准确率中等,思维链提升有限,而思维程序通过调用外部解释器实现了完美准确率。此外,训练小型领域模型生成可执行程序也能以极低代价达到完美准确。研究表明 LLM 更多是模拟推理模式而非可靠执行符号计算,结合外部工具或专用模型是更优解。

AI 推荐理由

核心研究 LLM 在确定性计算中的推理能力,系统评估 CoT 等推理策略的局限与改进。

研究机构
Virginia Tech
论文信息
作者 Hongkun Yu
发布日期 2026-05-04
arXiv ID 2605.03227
相关性评分 9/10 (高度相关)