摘要
本文提出了一种评估和基准测试逻辑推理智能体的框架,确保评估过程可复现、可审计且对执行失败具有鲁棒性。该框架利用评估智能体发布任务、执行预算控制、解析输出并记录结构化失败类型,被测智能体仅需暴露标准化的智能体间接口。作为案例研究,我们在经过求解器验证和修复的 FOLIO 数据集上基准测试了一个用于一阶逻辑推理的自动形式化智能体。该智能体将自然语言前提和结论翻译为可执行的 Z3Py 程序,并利用 SMT 求解确定逻辑蕴含关系。实验表明,在清洗后的验证集上,该智能体准确率达 86.70%,优于思维链基线。
AI 推荐理由
论文核心评估逻辑推理智能体,提出自动化形式化方法解决一阶逻辑推理问题。
研究机构
加州大学伯克利分校
论文信息