推理评估 指标设计 置信度过滤 LLM 基准测试
摘要

大型语言模型在推理基准测试中虽准确率高,但仅凭结果无法反映推理质量,存在因记忆或过优化导致错误推理得出正确答案的现象。本文提出超越基于结果的评估,从忠实度、连贯性、效用性和事实性等维度量化推理质量。针对多轨迹聚合难题,作者引入“过滤推理分数”(FRS),仅利用置信度最高的前 K% 轨迹进行计算。实验表明,FRS 能有效区分准确率相近模型的推理能力差异,且具有高泛化性,是准确率指标的重要补充。

AI 推荐理由

论文提出过滤推理分数(FRS)以评估推理质量,核心聚焦于推理能力的度量与区分。

研究机构
University of Texas at Austin
论文信息
作者 Manas Pathak, Xingyao Chen, Shuozhe Li, Amy Zhang, Liu Leqi
发布日期 2026-04-13
arXiv ID 2604.11996
相关性评分 9/10 (高度相关)