摘要
尽管自洽性已知能提升符号推理性能,但因缺乏针对性评估基准,其对百科全书式知识召回的影响尚不明确。为此,本文利用数据驱动启发式方法为 MMLU 基准构建了知识召回子集,并通过对比 GSM8K 和 MedMCQA 的性能模式验证了其有效性。研究发现,自洽性在符号推理和知识召回任务中均能持续提升性能,即便其底层的思维链提示主要针对符号推理设计。最终,该方法在 MMLU 上取得了 89% 的准确率,刷新了使用 GPT-4o 的最佳性能记录。
AI 推荐理由
论文核心研究自洽性(Self-Consistency)对推理及知识召回的影响,属推理机制优化。
研究机构
CyberAgent
论文信息