摘要
心智理论(ToM)是社会智能的标志。尽管大语言模型在标准 ToM 基准上表现良好,但在复杂场景中常依赖提示工程模仿推理,缺乏泛化性。本文提出 CoSToM 框架,从机制解释转向主动干预。首先利用因果追踪映射 ToM 特征的内部分布,揭示关键层的语义编码特性;随后在这些层实施针对性的激活引导,实现轻量级对齐。实验表明,该方法显著增强了模型类人的社会推理能力及下游对话质量。
AI 推荐理由
论文聚焦心智理论推理,通过因果干预提升模型内在社会推理能力,属核心研究。
研究机构
国家工程研究中心大数据技术与系统,服务计算技术与系统实验室,华中科技大学
新加坡管理大学
论文信息