Mathematical Reasoning Formal Verification LLM Evaluation Lean 4
摘要

近年来,大语言模型生成形式化数学证明的能力显著提升。本文对比了多种大语言模型在 Lean 4 中生成形式化证明的有效性,旨在辅助相关项目研究。研究采用 pass@$k$和 refine@$k$作为基准指标,并在 miniF2F 和 miniCTX 数据集子集上进行评估。测试表明,Gemini 3.1 Pro 和 Claude Opus 4.7 整体表现最佳,前者在 miniF2F 上通过 refine@32 达到 92% 成功率,后者在 miniCTX 上达 86%。若考虑成本因素,NVIDIA Nemotron 3 Super 和 GPT-OSS 120B 最具效率,在保证竞争力的准确率同时,单次正确证明平均成本低于 0.01 美元。

AI 推荐理由

论文核心评估 LLM 在形式化数学证明中的推理能力,直接对应逻辑与数学推理主题。

研究机构
Math AI Lab, University of Washington, Seattle, WA, USA
论文信息
作者 Tyson Klingner, Drew Bladek, Escher Crawford, Bohao Chen, Ariel Fu et al.
发布日期 2026-06-04
arXiv ID 2606.05632
相关性评分 9/10 (高度相关)