摘要
现有 NLP 研究常将矛盾视为需通过取舍来解决的错误,而人类推理的关键在于能提出调和矛盾的解释。尽管大语言模型(LLM)推理能力日益增强,其生成此类调和解释的能力尚未得到充分探索。本文引入了“调和性解释生成”任务,要求模型生成使矛盾陈述相容的解释。我们提出复用现有自然语言推理数据集的新方法,并引入可扩展的自动评估指标。对 18 个 LLM 的实验表明,大多数模型在此任务上表现有限,且随着模型规模增大,增加测试时计算量的收益趋于饱和。
AI 推荐理由
论文核心研究 LLM 在矛盾情境下的假设与解释生成能力,属于高阶逻辑推理范畴。
研究机构
谢菲尔德大学
论文信息