摘要
针对当前评估仅依赖最终答案正确性而忽视推理过程的问题,本研究提出了一种基于行为视角的统一多维框架,用于衡量大语言模型的推理质量。该框架操作化了六个理论维度:正确性、一致性、鲁棒性、逻辑连贯性、效率和稳定性。实验表明,该框架能揭示单一准确率指标无法发现的行为特征,如逻辑连贯性与正确性的正交关系,并有效防止因单指标评估导致的模型排名错误,为部署决策提供关键支持。
AI 推荐理由
论文提出多维框架评估 LLM 推理质量,核心聚焦推理过程的逻辑性与一致性。
研究机构
Department of Computer Engineering, Tarsus University, Taksim M. Kartaltepe S., Tarsus 33400, Mersin, Turkey
School of Computing and Augmented Intelligence (SCAI), Arizona State University (ASU), Tempe, AZ 85281, USA
HumaConn AI Consulting, Queen Creek, 85140, AZ, USA
论文信息