autoformalization mathematical reasoning benchmark dependency graph
摘要

现有自动形式化基准多集中于奥林匹克或本科数学,研究生及以上层级研究匮乏。本文提出 MathAtlas,首个大规模野外研究生级数学自动形式化基准,含约 5.2 万条定理、定义及证明,源自 103 本教材。其独创性地引入含约 17.8 万关系的数学依赖图,支持依赖感知系统评估。实验表明该基准极具挑战性:最强基线在定理陈述上正确率仅 9.8%,且模型性能随依赖深度增加显著下降,在最深依赖子集上正确率低至 2.6%。

AI 推荐理由

论文聚焦数学形式化,核心评估 LLM 的数学推理与逻辑转换能力,属推理领域关键基准。

研究机构
UC Santa Cruz
论文信息
作者 Nilay Patel, Noah Arias, Davit Babayan, Victoria Cochran, Timothy Libman et al.
发布日期 2026-05-13
arXiv ID 2605.14061
相关性评分 8/10 (高度相关)