基准污染 推理检测 多智能体系统 SWE-bench
摘要

针对大语言模型编码基准面临的可信度危机,本文提出跨上下文验证(CCV)方法。该方法通过在多个独立会话中解决同一问题并衡量解的多样性,结合分层跨上下文架构(HCCA),有效区分模型是依靠记忆检索还是真实推理。实验表明,污染呈现二元特征,推理缺失是完美判别器,且现有标签存在大量假阳性。研究证实信息限制而非结构复杂性是防止确认偏差的关键机制。

AI 推荐理由

论文核心在于区分模型是“回忆”还是“推理”,提出基于多样性检测推理缺失的方法。

论文信息
作者 Tae-Eun Song
发布日期 2026-03-23
arXiv ID 2603.21454
相关性评分 9/10 (高度相关)