Logical Reasoning Formal Verification Faithfulness Lean 4 LLM Evaluation
摘要

形式验证确保证明有效性,但无法保证形式化的忠实度。在自然语言逻辑推理中,模型需从头构建公理系统,有效证明与忠实翻译间的差距尤为显著。本文研究了前沿模型在生成 Lean 4 证明时是否利用此差距(即“形式化博弈”)。实验对比了统一生成与两阶段流水线方法,发现尽管编译率高,但未发现系统性博弈行为。然而,两阶段方法揭示了两种不忠实模式:GPT-5 在证明中虚构公理,而 DeepSeek-R1 在形式化阶段误译前提。研究表明高编译率不等于忠实推理。

AI 推荐理由

论文核心评估 LLM 在逻辑推理中的形式化忠实度,直接针对推理能力。

研究机构
EPFL
论文信息
作者 Kyuhee Kim, Auguste Poiroux, Antoine Bosselut
发布日期 2026-04-21
arXiv ID 2604.19459
相关性评分 9/10 (高度相关)