科学验证 组合推理 捷径学习 鲁棒性评估
摘要

科学主张验证旨在判断主张是否由证据蕴含,通常基于封闭世界假设。本文指出现有基准无法区分严谨验证与仅检查显著约束的捷径策略。为此,作者构建了组合不可行主张(显著约束支持但非显著约束矛盾),发现现有模型普遍过度接受此类主张,暴露了组合推理瓶颈。研究表明,不同模型的差异主要源于验证阈值而非推理能力,且该瓶颈是当前验证行为的结构性特征,难以仅通过策略引导克服。

AI 推荐理由

论文核心研究模型在科学主张验证中的组合推理缺陷及捷径启发式问题。

研究机构
University of Pennsylvania
论文信息
作者 Muxin Liu, Delip Rao, Grace Kim, Chris Callison-Burch
发布日期 2026-04-13
arXiv ID 2604.10990
相关性评分 9/10 (高度相关)