Mathematical Reasoning Evaluation Benchmark Proof Quality LLM Assessment
摘要

大语言模型虽能生成正确的数学证明,但仅凭正确性不足以衡量其价值。本文提出 ProofRank 基准,从数学竞赛中精选数据,评估证明的简洁性、计算简便性、认知简单性、多样性及适应性。研究发现,不同模型在证明质量上存在显著差异,且质量指标与正确性之间存在权衡。这表明未来的数学推理评估应关注 LLM 生成证明的实际效用,而不仅仅是结果的正确与否。

AI 推荐理由

论文核心评估 LLM 数学证明质量,深入探讨推理过程的简洁性、认知难度等维度。

研究机构
INSAIT 苏黎世联邦理工学院
论文信息
作者 Ivo Petrov, Jasper Dekoninck, Dimitar I. Dimitrov, Martin Vechev
发布日期 2026-05-11
arXiv ID 2605.10379
相关性评分 9/10 (高度相关)