Automated Theorem Proving LLM Reasoning Self-Reflection Lean 4 Agentic Framework
摘要

大多数自动定理证明基准将答案嵌入形式陈述中(“简单模式”),低估了任务难度。本文提出更真实的“困难模式”,要求系统独立发现答案后再构建证明。为此,我们发布了 MiniF2F-Hard 和 FIMO-Hard 两个专家重标注的基准,并推出“发现与证明”(DAP)智能体框架。该框架利用大模型的自然语言推理及显式自我反思来发现答案,随后将问题转化为简单模式供现有证明器处理。实验表明,DAP 在 CombiBench 和 PutnamBench 上均创下新纪录,揭示了大模型在答案准确性上远超形式证明器的现状。

AI 推荐理由

论文核心在于利用 LLM 的自然语言推理与自我反思解决高难度定理证明,属推理能力研究。

研究机构
State Key Laboratory for Multimedia Information Processing, School of Computer Science, PKU-Anker LLM Lab, Peking University, Huawei Technologies Co., Ltd. School of Software & Microelectronics, Peking University School of Electronics Engineering and Computer Science, Peking University
论文信息
作者 Chengwu Liu, Yichun Yin, Ye Yuan, Jiaxuan Xie, Botao Li et al.
发布日期 2026-04-17
arXiv ID 2604.15839
相关性评分 9/10 (高度相关)