LLM 评判 推理链 事实性检测 表面偏差
摘要

大语言模型常被用作人类评估的替代,但易受表面偏差影响。本文系统研究了访问推理链如何影响基于 LLM 的评判者在事实问答和数学推理基准上的表现。研究发现,弱评判者易被流畅但错误的推理误导,而强评判者虽能部分利用推理作为证据,仍可能被高质量表象的推理链欺骗。实验表明,推理链的流畅性与事实性均是驱动评判决策的关键信号,亟需开发能区分真实推理质量与表面流畅性的鲁棒评判模型。

AI 推荐理由

论文核心研究推理链对 LLM 判断事实性的影响,深入探讨推理质量与流畅度的作用机制。

研究机构
State Key Laboratory of AI Safety Institute of Computing Technology, Chinese Academy of Sciences University of Chinese Academy of Sciences
论文信息
作者 Minzhu Tu, Shiyu Ni, Keping Bi
发布日期 2026-04-08
arXiv ID 2604.06756
相关性评分 9/10 (高度相关)