数学推理 形式化验证 LLM 评估 证明助手 Lean4
摘要

随着大型推理模型在解决数学问题上的普及,准确衡量其能力至关重要。本文提出一种自动与交互式验证流水线,作为当前仅检查答案的基准测试方法的更精准替代方案。该流水线还能生成形式化与非形式化语言的正确解。架构包含三个可选 AI 代理,核心思想是利用提示词获取特定格式的解,以便借助证明助手进行高效验证,并允许使用小模型(≤8B)。多数据集实验表明误报率极低。

AI 推荐理由

论文聚焦数学解验证,直接评估和提升 LLM 逻辑推理准确性,属核心研究。

研究机构
莫斯科国立大学 华为技术有限公司
论文信息
作者 Varvara Sazonova, Dmitri Shmelkin, Stanislav Kikot, Vasily Motolygin
发布日期 2026-02-24
arXiv ID 2602.20770
相关性评分 9/10 (高度相关)