摘要
现有 AI 推理基准难以揭示其在自然语境下与人类推理的相似程度。本文改编“华生与福尔摩斯”侦探桌游,提出新基准,通过逐步呈现的叙事证据、开放式问题及非约束语言回答来评估推理性能。研究开发并验证了自动评分系统,以实现可扩展且可复现的评估。结果显示,2025 年九个月内,模型表现从人类对比组的下四分位提升至前 5%。其中一半进步源于模型迭代,另一半归因于面向推理的架构变革。除长案例性能下降及早期归纳推理优势外,模型与人类无显著系统性差异。
AI 推荐理由
论文核心是构建基准以评估和比较人类与 LLM 在自然语境下的推理能力,直接聚焦推理主题。
研究机构
计算机科学,伦敦大学学院,英国
论文信息