摘要
大型语言模型虽具备强大语言能力,但在无需额外训练的多步推理任务中表现不可靠。本文系统评估了三种推理时策略:基于随机解码的自一致性、双模型推理一致性验证及自我反思。实验结合思维链提示,在相同设置下进行对比。结果显示,受控温度下的核采样自一致性方法效果显著,准确率提升 9% 至 15%;双模型方法适用于中等风险场景;而自我反思对小型非推理模型改进有限。
AI 推荐理由
论文核心研究推理时技术以提升多步推理准确率,直接针对推理能力优化。
研究机构
Firstsource
论文信息