摘要
思维链(CoT)忠实度通常通过上下文扰动或参数干预两种独立范式评估,但缺乏比较研究。本文提出 FaithMate,一个统一的偏好对齐接口,用于优化模型以适应任一忠实度范式,从而探究两者间的相互作用。实验发现两种范式正相关但不对称:优化参数忠实度能带来跨范式的一致增益,而上下文优化增益则多变。此外,上下文范式内不同指标间增益无法一致迁移,表明现有指标捕捉的是忠实度的不同侧面,存在内在权衡。研究结论指出 CoT 忠实度非单一目标,需多维度优化与评估。
AI 推荐理由
论文核心研究思维链(CoT)的忠实度及其优化机制,直接关联推理能力的可靠性评估。
研究机构
University of Copenhagen
Technische Universität Berlin
German Research Center for Artificial Intelligence (DFKI)
论文信息