自动形式化 强化学习 数学推理 Lean4 循环一致性
摘要

自动形式化旨在将自然语言数学文本翻译为 Lean4 等形式证明语言,以加速 AI 辅助数学研究。本文在 FineLeanCorpus 数据集上,利用 LoRA 微调 Qwen3.5-2B 模型,对比了三种训练策略:带课程学习的监督微调、无课程排序的监督微调,以及基于循环一致性奖励的强化学习(GRPO)。循环一致性通过衡量

AI 推荐理由

论文聚焦数学形式化,直接提升 LLM 的逻辑与数学推理能力,属核心研究。

研究机构
斯坦福大学计算机科学系
论文信息
作者 Arsen Shebzukhov
发布日期 2026-03-25
arXiv ID 2603.24372
相关性评分 9/10 (高度相关)