Chain-of-Thought Model Compression Trustworthiness Safety Hallucination
摘要

长思维链(Long-CoT)推理模型引发了大量关于压缩推理轨迹以降低推理成本的研究,但现有评估几乎仅关注任务准确率和令牌节省。由于可信度属性与压缩所修改的参数空间相同,保持准确率并不保证保持可信度。本文首次系统实证研究了 CoT 压缩如何影响模型可信度,从安全性、抗幻觉能力和多语言鲁棒性三个维度评估了不同规模的模型。研究发现,CoT 压缩常导致可信度退化,且不同方法的退化特征各异。为此,我们提出了归一化效率评分以揭示权衡,并引入一种对齐感知的 DPO 变体,在显著减少可信度损失的同时将 CoT 长度缩短了 19.3%。

AI 推荐理由

论文核心研究思维链(CoT)压缩对推理模型可信度的影响,直接关联推理机制。

研究机构
Mohamed bin Zayed University of Artificial Intelligence
论文信息
作者 Lingjie Zeng, Xiaofan Chen, Yanbo Wang, Xiuying Chen
发布日期 2026-04-05
arXiv ID 2604.04120
相关性评分 9/10 (高度相关)