逻辑推理 提示工程 OWL 本体 错误修正
摘要

本文报告了 GPT-5.4 在 OWL~2~DL 合规查询中的可复现错误模式:模型常在功能属性闭包或类不相交下将推理器蕴含的“否”误答为“未知”。通过在保险和临床领域构建的 198 个查询,对比了四种交互模式。结果显示,仅包含推理器裁决的修复策略准确率高达 97.8%,而加入开放世界假设提示反而降低性能至 67.2%。研究表明,提示框架比纠正内容更关键,推理器引导的包装需明确消融验证。

AI 推荐理由

研究通过提示设计优化 LLM 在逻辑蕴含否定下的推理修正,核心聚焦推理能力。

研究机构
University of Michigan Ann Arbor, MI, USA ByteDance Inc. San Jose, CA, USA University of Pennsylvania Philadelphia, PA, USA
论文信息
作者 Yijiashun Qi, Xiang Xu, Yuxuan Li
发布日期 2026-04-25
arXiv ID 2604.23398
相关性评分 9/10 (高度相关)