Chain-of-Thought Faithfulness Preference Alignment LLM Evaluation
摘要

思维链(CoT)忠实度通常通过上下文扰动或参数干预两种独立范式评估,但缺乏比较研究。本文提出 FaithMate,一个统一的偏好对齐接口,用于优化模型以适应任一忠实度范式,从而探究两者间的相互作用。实验发现两种范式正相关但不对称:优化参数忠实度能带来跨范式的一致增益,而上下文优化增益则多变。此外,上下文范式内不同指标间增益无法一致迁移,表明现有指标捕捉的是忠实度的不同侧面,存在内在权衡。研究结论指出 CoT 忠实度非单一目标,需多维度优化与评估。

AI 推荐理由

论文核心研究思维链(CoT)的忠实度及其优化机制,直接关联推理能力的可靠性评估。

研究机构
University of Copenhagen Technische Universität Berlin German Research Center for Artificial Intelligence (DFKI)
论文信息
作者 Jingyi Sun, Qianli Wang, Pepa Atanasova, Nils Feldhus, Isabelle Augenstein
发布日期 2026-05-24
arXiv ID 2605.24960
相关性评分 9/10 (高度相关)