摘要
本文报告了 GPT-5.4 在 OWL~2~DL 合规查询中的可复现错误模式:模型常在功能属性闭包或类不相交下将推理器蕴含的“否”误答为“未知”。通过在保险和临床领域构建的 198 个查询,对比了四种交互模式。结果显示,仅包含推理器裁决的修复策略准确率高达 97.8%,而加入开放世界假设提示反而降低性能至 67.2%。研究表明,提示框架比纠正内容更关键,推理器引导的包装需明确消融验证。
AI 推荐理由
研究通过提示设计优化 LLM 在逻辑蕴含否定下的推理修正,核心聚焦推理能力。
研究机构
University of Michigan
Ann Arbor, MI, USA
ByteDance Inc.
San Jose, CA, USA
University of Pennsylvania
Philadelphia, PA, USA
论文信息