Self-Consistency Knowledge Recall MMLU Reasoning
摘要

尽管自洽性已知能提升符号推理性能,但因缺乏针对性评估基准,其对百科全书式知识召回的影响尚不明确。为此,本文利用数据驱动启发式方法为 MMLU 基准构建了知识召回子集,并通过对比 GSM8K 和 MedMCQA 的性能模式验证了其有效性。研究发现,自洽性在符号推理和知识召回任务中均能持续提升性能,即便其底层的思维链提示主要针对符号推理设计。最终,该方法在 MMLU 上取得了 89% 的准确率,刷新了使用 GPT-4o 的最佳性能记录。

AI 推荐理由

论文核心研究自洽性(Self-Consistency)对推理及知识召回的影响,属推理机制优化。

研究机构
CyberAgent
论文信息
作者 Sho Hoshino, Ukyo Honda, Peinan Zhang
发布日期 2026-04-21
arXiv ID 2604.19395
相关性评分 9/10 (高度相关)