摘要
人类能轻松超越字面含义进行语用推理,而大型语言模型(LLM)是否具备此类推理尚不明确。本研究通过跨四种语言的群体匹配实验,对比了 25 个 LLM 与人类在条件推断上的表现。研究发现,人类普遍利用语用推理丰富逻辑判断,而 LLM 表现不一:部分仅遵循真值表忽略语用,部分则偏离真值表但缺乏灵活性。总体而言,LLM 是准确的语义算子,但未能捕捉人类推理特有的语用增强特征,且其表现不受模型架构或训练方式显著影响。
AI 推荐理由
论文核心评估 LLM 的条件推理与语用推理能力,直接对比人类推理机制。
研究机构
Departament de Filologia Catalana, Universitat Autònoma de Barcelona, Barcelona 08193, Spain
Institut für Psychologie, Humboldt-Universität zu Berlin, Berlin 10099, Germany
Institució Catalana de Recerca i Estudis Avançats (ICREA), Barcelona 08010, Spain
论文信息