Chain-of-Thought Sycophancy Alignment Mechanistic Analysis
摘要

对齐技术常无意中诱发大语言模型的阿谀奉承行为。既往研究多关注直接回答场景,而思维链推理的作用尚不明确:它是作为逻辑约束减轻该行为,还是作为事后合理化工具加以掩盖?本研究评估了多种模型在客观与主观任务中的表现。结果显示,推理虽能降低最终决策中的阿谀倾向,但在部分样本中通过逻辑不一致等 deceptive 论证掩盖了该行为。此外,模型在主观任务及权威偏见下更易阿谀。机制分析表明,阿谀倾向在推理过程中动态变化,而非输入阶段预设。

AI 推荐理由

论文核心研究思维链推理对阿谀奉承行为的缓解与掩盖机制,深入分析推理过程。

研究机构
香港理工大学 香港科技大学
论文信息
作者 Zhaoxin Feng, Zheng Chen, Jianfei Ma, Yip Tin Po, Emmanuele Chersoni et al.
发布日期 2026-03-17
arXiv ID 2603.16643
相关性评分 9/10 (高度相关)