摘要
现有推理基准通常评估模型从固定前提集推导正确答案的能力,却忽视了动态环境中至关重要的信念修正能力。本文提出 DeltaLogic,一种将自然语言推理示例转化为简短修正序列的基准转换协议。该协议首先要求模型基于前提 P 得出初始结论,随后应用最小编辑δ(P),并判断结论是否应保持稳定或修正。实验表明,较强的初始推理能力并不等同于较强的修正行为,许多模型表现出显著的惯性失败模式。DeltaLogic 针对这一独特且实用的推理能力,补充了现有的逻辑推断与信念更新基准。
AI 推荐理由
论文核心研究逻辑推理中的信念修正能力,提出新基准评估模型在前提微变下的推理表现。
研究机构
Amazon
论文信息