LLM 伦理 推理机制 诚实度 表示空间分析
摘要

现有研究多关注大语言模型的欺骗率,却鲜少探讨其成因。本文利用包含道德权衡的新数据集发现,与人类不同,推理能显著提升各类 LLM 的诚实度。研究表明,该效应不仅源于推理内容,更归因于表示空间的几何特性:欺骗性回答在空间中处于亚稳态,易受扰动而失稳;而推理过程引导模型穿越有偏空间,最终趋向更稳定的诚实默认状态。

AI 推荐理由

论文核心研究推理过程如何改变模型行为,揭示推理提升诚实度的机制。

研究机构
Google DeepMind 卡内基梅隆大学
论文信息
作者 Ann Yuan, Asma Ghandeharioun, Carter Blum, Alicia Machado, Jessica Hoffmann et al.
发布日期 2026-03-10
arXiv ID 2603.09957
相关性评分 9/10 (高度相关)