摘要
现有研究多关注大语言模型的欺骗率,却鲜少探讨其成因。本文利用包含道德权衡的新数据集发现,与人类不同,推理能显著提升各类 LLM 的诚实度。研究表明,该效应不仅源于推理内容,更归因于表示空间的几何特性:欺骗性回答在空间中处于亚稳态,易受扰动而失稳;而推理过程引导模型穿越有偏空间,最终趋向更稳定的诚实默认状态。
AI 推荐理由
论文核心研究推理过程如何改变模型行为,揭示推理提升诚实度的机制。
研究机构
Google DeepMind
卡内基梅隆大学
论文信息