Logical Reasoning Agent Evaluation Auto-formalization SMT Solving
摘要

本文提出了一种评估和基准测试逻辑推理智能体的框架,确保评估过程可复现、可审计且对执行失败具有鲁棒性。该框架利用评估智能体发布任务、执行预算控制、解析输出并记录结构化失败类型,被测智能体仅需暴露标准化的智能体间接口。作为案例研究,我们在经过求解器验证和修复的 FOLIO 数据集上基准测试了一个用于一阶逻辑推理的自动形式化智能体。该智能体将自然语言前提和结论翻译为可执行的 Z3Py 程序,并利用 SMT 求解确定逻辑蕴含关系。实验表明,在清洗后的验证集上,该智能体准确率达 86.70%,优于思维链基线。

AI 推荐理由

论文核心评估逻辑推理智能体,提出自动化形式化方法解决一阶逻辑推理问题。

研究机构
加州大学伯克利分校
论文信息
作者 Zhiyu Ni, Yifeng Xiao, Zheng Liang
发布日期 2026-03-03
arXiv ID 2603.02788
相关性评分 9/10 (高度相关)