一阶逻辑 概念合成 归纳推理 基准测试 逻辑泛化
摘要

本文提出 INDUCTION 基准,用于评估一阶逻辑中有限结构的概念合成能力。给定带有扩展标记目标谓词的小型有限关系世界,模型需输出单个一阶逻辑公式以统一解释所有世界中的目标,并通过精确模型检查验证正确性。该基准包含全观察、对比及存在补全三种机制,并惩罚公式冗余。研究发现难度梯度显著,存在持久的困难结构族,且低冗余公式在未见世界上泛化性更佳。

AI 推荐理由

论文聚焦一阶逻辑中的概念合成与归纳推理,评估模型逻辑泛化能力,属核心推理研究。

研究机构
未提供具体单位
论文信息
作者 Serafim Batzoglou
发布日期 2026-02-21
arXiv ID 2602.18956
相关性评分 9/10 (高度相关)